Esta é uma tradução automática e o texto em inglês é o original. Ler o original

Existem duas retas de regressão, e R² é a distância entre elas

A young woman crouches at a tripod-mounted surveying instrument on a grassy hillside at dusk, sighting across a wide valley towards a colleague standing on the far ridge holding a striped ranging pole.

Ao trocar a variável que considera a entrada, a reta de melhor ajustamento desloca-se. R² mede precisamente quanto.

y on x (slope 0.5)x on y (slope 2)RATIO OF SLOPES0.5 / 2 = 0.25 = r²TOOL DEFAULTr = 0.998 R² = 0.996
Uma nuvem de pontos, duas retas de melhor ajustamento. Com r = 0,5, um declive é quatro vezes o outro.

Os mínimos quadrados encontram a reta que minimiza os erros quadráticos. A frase esconde uma escolha: erros medidos em que direção?

Ajustar y em função de x minimiza as distâncias verticais. Ajustar x em função de y minimiza as horizontais. São problemas diferentes com respostas diferentes, e ambos são chamados a reta de regressão.

Os dois declives

Escreva r para a correlação e s para os desvios-padrão. A reta de y em x tem declive r·sy/sx. A reta de x em y, desenhada nos mesmos eixos, tem declive sy/(r·sx).

Divida um pelo outro e tudo se cancela, exceto .

Isto não é uma coincidência nem uma aproximação. A razão dos dois declives é R², o número que qualquer programa de estatística apresenta e que a maioria dos leitores trata como uma pontuação vaga de zero a um.

Porque é que ninguém repara

Abra o Linear Regression e este indica um r de Pearson = 0,998 com R² = 0,996 nos seus pontos predefinidos. Eleve o primeiro ao quadrado e obtém o segundo, exatamente.

Isto significa também que as duas retas nesses dados predefinidos diferem em 0,4%. Não seria possível ver a diferença se ambas fossem desenhadas, o que é precisamente a razão pela qual a ambiguidade passa despercebida: os dados de demonstração apresentam quase sempre uma correlação forte.

Diminua essa correlação e as duas retas separam-se rapidamente:

  • r = 0,9 → os declives diferem em 19%
  • r = 0,5 → um declive é quatro vezes o outro
  • r = 0 → uma reta é horizontal, a outra vertical

Com correlação nula, as duas respostas estão em ângulo reto. Ambas continuam corretas, porque cada uma é o melhor previsor do seu próprio alvo.

O caso r = 0,5 em números

Considere duas variáveis com igual dispersão e correlação 0,5. Prever y a partir de x dá um declive de 0,5: um ponto um desvio-padrão à direita da média prevê meio desvio-padrão acima da média.

Agora preveja x a partir de y. Esse declive também é 0,5 no seu próprio referencial, mas desenhado nos eixos originais passa a ser 1/0,5 = 2.

Uma reta sobe a 0,5, a outra a 2, através da mesma nuvem de pontos, e 0,5 / 2 = 0,25, que é r². Nenhuma delas é um ajustamento pior do que a outra. Respondem a perguntas diferentes, e os dados por si só não podem dizer qual delas pretendia.

Isto é a regressão à média

Escrita em unidades de desvio-padrão, a reta de y em x é simplesmente zy = r · zx. Como r é no máximo 1, a previsão está sempre mais próxima da média do que o valor de entrada estava.

Pais altos têm filhos altos, mas mais próximos da média. Empresas com um ano espetacular tendem a ter a seguir um ano apenas bom. Nenhum dos casos precisa de uma causa, e a armadilha é que o efeito é simétrico: esses filhos também têm pais mais próximos da média do que eles próprios. Qualquer explicação que justifique o fenómeno numa direção é desmentida pela outra.

Galton chamou-lhe regressão para a mediocridade, e a palavra regressão ficou associada a toda a técnica por causa disso.

Quando nenhuma das retas é a que pretende

Ambas as retas assumem que uma variável é medida sem erro. Se ambas apresentarem ruído, como ao comparar dois instrumentos, ambas as retas são enviesadas e a resposta situa-se entre elas.

O Least-Squares Geometry torna concreta a imagem subjacente: o ajustamento é uma projeção, e a reta obtida depende da direção ao longo da qual se projeta. O seu ajustamento predefinido indica uma SSE de 1,3714, com 37,2% desse valor a dever-se a um único ponto, que é a outra coisa que o método dos mínimos quadrados faz discretamente. Elevar os erros ao quadrado significa que um único ponto distante pode ter mais peso do que muitos pontos próximos.

Assim, antes de indicar um declive, decida para que serve. Prever y a partir de x é uma questão, estimar uma relação física entre duas grandezas com ruído é outra, e apenas a primeira tem uma única reta óbvia.