O bilhar de Bayes — O feijão jogado sobre o ombro

Veja uma distribuição a priori não observada transformar-se numa curva a posteriori Beta, um relato de ordenação de cada vez.

A carregar a simulação interativa...

relatórios de ordem sem medição são suficientes 🖖

Você nunca vê onde o primeiro feijão caiu, e os seguintes apenas reportam se caíram à esquerda ou à direita. Nenhuma distância é medida. No entanto, um único relatório 'à esquerda' desloca a crença de 50/50 para 0,7500. A evidência se acumula apenas pela ordenação.

a precisão custa quatro vezes o que você pensa 🖖

Reduzir o intervalo de credibilidade de 95% a ±5 pontos percentuais (largura 0,10) exige 381 lançamentos, se os feijões caírem de forma equilibrada e o intervalo for calculado exatamente. Duplicar essa precisão, para ±2,5 pontos (largura 0,05), exige 1 534, numa razão de 4,03. A precisão varia como 1/√n; reduzir a largura para metade custa quatro vezes mais evidência. O painel usa uma aproximação normal para fazer a previsão e indica 385 para o primeiro caso.

a distribuição a priori uniforme aqui é um fato físico 🖖

No experimento de pensamento de Thomas Bayes, o primeiro feijão foi realmente jogado às cegas sobre uma mesa plana, tornando a distribuição uniforme um fato físico. Na triagem médica, a prevalência desempenha o mesmo papel, mas é uma estimativa a ser comprovada.

Problemas resolvidos na íntegra

  1. Um feijão, uma indicação de «esquerda» e quatro respostas corretas diferentes 8 passos

    Lançado um único feijão, este cai à esquerda do marcador oculto. O painel indica 0,6667. O primeiro bloco de análise nesta página indica 0,7500. A resposta que a maioria das pessoas dá em voz alta é 1, porque um em um caiu à esquerda. As três estão corretas. A que pergunta responde cada uma delas?

    1. Primeiro, o contexto, por ser a razão pela qual esta experiência mental em particular é famosa. Um marcador é lançado às cegas sobre uma mesa plana numa posição desconhecida p, e cada feijão lançado a seguir cai à sua esquerda com probabilidade p. Nada é medido diretamente; cada feijão transmite apenas um bit. Richard Price leu o ensaio à Royal Society em dezembro de 1763, dois anos após a morte de Bayes, e a distribuição a priori uniforme sobre p é um facto físico relativo à forma como o marcador foi lançado, e não uma opção de modelação. Isso é mais raro do que parece, e o terceiro bloco de análise nesta página aborda quão raramente tal ocorre em qualquer outro contexto.

    2. A evidência. Obter k à esquerda em n lançamentos tem probabilidade pk(1−p)n−k, multiplicada por um coeficiente binomial que não contém a variável p. Multiplica-se pela distribuição a priori plana, normaliza-se, e o coeficiente é eliminado por divisão.

    3. Resta uma distribuição Beta cujos dois parâmetros são esses expoentes acrescidos de um. Um resultado à esquerda num único lançamento dá Beta(2, 1), uma reta que começa em zero na extremidade esquerda e sobe até 2 na direita.

    4. Primeira pergunta: onde é mais provável que o marcador esteja? A densidade 2p atinge o máximo no extremo direito, pelo que a moda é p = 1. A resposta precipitada k/n = 1 chega ao mesmo ponto por um caminho diferente, e ambas são respostas a uma pergunta que ninguém fez.

    5. Segunda pergunta: o marcador está para lá de metade da mesa? Trata-se de uma área, pelo que se integra. A função de distribuição acumulada de Beta(2, 1) é p², pelo que a massa acima de metade é 1 − ¼. Este é o valor 0,7500 no primeiro bloco de análise.

    6. Terceira pergunta: o próximo feijão cairá à esquerda? Esta questão não diz de todo respeito a onde p se encontra — refere-se ao que acontece a seguir e calcula a média de p sobre tudo o que agora se supõe acerca de p. Essa média é a média a posteriori.

    7. Com n = 1 e k = 1 a média é dois terços. Laplace deduziu isto numa memória de 1774 e a expressão ficou conhecida como regra de sucessão desde então. O +1 e o +2 não são um ajuste arbitrário para amostras pequenas; são o resultado exato da integração com uma distribuição a priori plana.

    8. Há ainda um quarto número, que a ferramenta não mostra em lado nenhum. A mediana fica em 1/√2, entre a média e a moda, por esta ordem. Toda distribuição a posteriori que esta ferramenta pode produzir é uma Beta. Quando a massa de uma Beta se concentra à direita, os seus três centros aparecem exatamente nessa ordem, e as distâncias entre eles voltam a diminuir à medida que a evidência concentra a curva. Equilibre os lançamentos e os três acabam por coincidir.

    Resposta

    Os três valores estão certos, mas respondem a perguntas diferentes. 1 é a posição mais provável do marcador. 0,7500 é a probabilidade de ele estar para lá do ponto médio. 0,6667 é a probabilidade de o próximo feijão cair à esquerda. É este último valor que o painel destaca no cartão principal, pois é o único dos três que diz alguma coisa sobre o próximo lançamento. O intervalo de 95% vai de 0,1581 a 0,9874: um único resultado quase não o estreitou, e o painel indica mais 341 lançamentos até a sua largura chegar a ±5 pontos.

    Laplace levou a mesma fórmula até ao limite. No Essai philosophique sur les probabilités, de 1814, tomou n = 1 826 213 (cinco mil anos de nasceres do Sol registados) e concluiu que havia uma possibilidade em 1 826 215 de o Sol não nascer no dia seguinte. Desde então, tem sido alvo de troça, sobretudo por parte de quem não continuou a ler. Na mesma passagem, esclarece que esse número se aplica a alguém que nada sabe sobre o mecanismo que faz suceder os dias e que quem o compreende deve atribuir uma probabilidade muito maior ao nascer do Sol. Essa ressalva é o passo 1, formulado pelo próprio inventor do cálculo.

  2. Do que é uma promessa o 95% do intervalo 6 passos

    Execute a predefinição de 400 lançamentos. O painel coloca o marcador entre 0,4512 e 0,5488 com 95% de credibilidade, e o marcador está de facto em 0,4913. Mostre que esse 95% é exato e não aproximado, e calcule depois o que resta dele se a mesa não for plana.

    1. Volte a contar os feijões, incluindo aquele para que ninguém olha. O marcador foi lançado às cegas sobre a mesa, tal como os 400 que se seguiram; os 401 saíram do mesmo ombro para a mesma superfície plana. Nada de estatístico distingue o marcador de um lançamento. Apenas tem nome.

    2. Tome então as 401 posições e ordene-as. O marcador tem igual probabilidade de ser o primeiro, o sétimo ou o último, porque um rótulo não altera uma ordem, e o número a que o painel chama k é apenas a sua posição menos um. Cada contagem de «à esquerda» que a ferramenta pode apresentar, todas as 401, de 0 a 400, tem probabilidade 1/401. Isso não se parece com uma contagem de lançamentos de moeda, e o integral confirma-o: o coeficiente binomial anula-se contra a função beta e n desaparece a não ser como n + 1.

    3. A mesma simetria resolve o intervalo. Introduza a posição verdadeira do marcador na sua própria função de distribuição a posteriori e o resultado é uniforme no intervalo unitário: é isso que significa uma distribuição a posteriori ser a lei condicional honesta de p. Portanto, a probabilidade de a verdade cair entre os percentis 2,5 e 97,5 é 0,95, e não há aproximação nenhuma nessa frase. Simular dez lançamentos cem mil vezes dá 0,94967.

    4. Vale para qualquer dimensão de amostra, e é aí que convém parar. O intervalo dos 400 lançamentos tem 0,0976 de largura e o marcador cai folgadamente lá dentro. O intervalo de um único lançamento vai de 0,1581 a 0,9874, e não exclui quase nada, mas é exatamente tão válido. Ser inútil e estar errado são falhas diferentes.

    5. Quebre agora a única coisa em que assenta. Suponha que a mesa não é plana mas abaulada, de modo que o marcador tende a rolar para uma tabela, enquanto o painel continua a calcular a partir de uma distribuição a priori uniforme. Integre a cobertura sobre essa distribuição verdadeira e o rótulo dos 95% vale 68,7% após um lançamento, 78,7% após dez e 87,1% após cem.

    6. Repare no sentido da falha e na lentidão com que a evidência a repara. Multiplicar os dados por cem fechou pouco mais de metade da diferença. E uma mesa abaulada ao contrário, que junta o marcador perto do meio, deixa antes o intervalo demasiado largo: 99,9%, 95,8%, 95,1%. O que faz mal são as bordas, porque é aí que uma distribuição a priori plana está mais confiante e mais errada.

    Resposta

    Exatamente 95%, para qualquer n, pela razão que o terceiro bloco de análise dá: aqui a distribuição a priori uniforme é um facto sobre o lançamento e não uma opção de modelação. É raro poder dizer-se isto, e faz deste o único sítio onde um intervalo bayesiano e um intervalo de confiança frequentista são o mesmo objeto em vez de duas coisas que costumam concordar.

    O 1/401 é a metade mais limpa dessa mesma simetria, e é a linha a reter. Antes de se lançar um único feijão, todas as contagens possíveis de «à esquerda» são igualmente prováveis: a distribuição a priori plana não se limita a estar por baixo do cálculo, também achata os dados. É por isso que o +1 e o +2 da regra de sucessão são exatos e não um remendo para amostras pequenas.

    Fica assim de pé a pergunta que a mesa não consegue responder para mais nada. A prevalência num programa de rastreio, a taxa de base de uma avaria rara, a fração de uma população com um traço: cada uma desempenha o papel estrutural de p e nenhuma foi lançada às cegas sobre coisa alguma. Engane-se nessa distribuição junto às bordas e os 95% do relatório são 69%, e nenhuma amostragem adicional ao seu alcance lho dirá, porque cem lançamentos só recuperaram metade daquilo que uma mesa abaulada custou.

Percurso de aprendizagem

O a priori e de onde ele vem

Conduz a Bioassinaturas um a priori uniforme que não foi presumido.

Referências (2)

Problemas de exemplo

  • 1º lançamento - 1 lançamento à esquerda: P(primeiro feijão na metade direita) passa de 50/50 para 0,7500.
  • 10 lançamentos - 10 lançamentos, 5 à esquerda: a largura do intervalo de credibilidade de 95% reduz para 0,5324.
  • 100 lançamentos - 100 lançamentos, 50 à esquerda: a largura do intervalo de credibilidade de 95% reduz para 0,1927.
  • 400 lançamentos (±5%) - 400 lançamentos, 200 à esquerda: a largura do intervalo atinge 0,0976 (±5 pontos percentuais).