Lição
A teoria — Regressão Linear
A reta dos mínimos quadrados é a única reta que torna a soma dos desvios verticais ao quadrado entre os pontos e a reta o menor possível. Ao quadrado por duas razões: para que os desvios acima e abaixo não se anulem mutuamente, e para que um desvio grande conte mais do que vários pequenos.
O que significa cada símbolo
b- o declive — quanto y varia por cada unidade de x.
a- a ordenada na origem — o valor ajustado de y quando
x = 0, querx = 0esteja ou não perto dos dados. ŷ- um valor ajustado: o que a reta prevê para um dado x. O chapéu distingue-o de um y observado.
R²- a proporção da variação em y explicada pela reta, entre 0 e 1.
r- o r de Pearson, a correlação — a mesma informação que
R², mas com sinal, pelo que inclui também a direção.
De onde vem a fórmula
- Escreva a quantidade a minimizar:
S = Σ(y − a − b·x)², somada para todos os pontos. Sé uma função suave de a e b, pelo que no seu mínimo ambas as derivadas parciais são zero. Igualando-as a zero obtêm-se duas equações lineares em a e b — as equações normais.- Resolvendo estas equações em ordem ao declive obtém-se
b = (n·Σxy − Σx·Σy) / (n·Σx² − (Σx)²)— a fórmula apresentada acima com as cinco somas substituídas:(5·69.7 − 15·19.8) / (5·55 − 15²) = 51.5 / 50 = 1.03.
- Pressupõe
- Que uma reta é o modelo adequado à partida, e que todo o erro reside em y: são os desvios verticais que são minimizados, pelo que x é tratado como sendo exatamente conhecido. Todos os pontos têm também o mesmo peso, por mais afastados que estejam dos restantes.
- Falha quando
- A reta não faz ideia de onde terminam os seus dados. Os pontos por omissão vão de
x = 1ax = 5; peça uma previsão parax = 6e ela devolveŷ(6) = 7.05sem o mínimo aviso de que está agora a extrapolar para além de todas as observações em que se baseou. UmR²elevado também não é garantia de nada — mede o quão bem a reta se ajusta aos dados, mas nunca se uma reta era o modelo adequado a ajustar.
Prática
Verifique você mesmo
Preveja primeiro a resposta e depois use os controlos acima para confirmar. Revele a solução só depois de se ter comprometido com um palpite — é isso que torna isto prática.
-
Carrega em Spearman ρ=1: os pontos
1, 2.5, 5, 9, 16, 28sobem a cada passo, e o nome do predefinido já denuncia queρ = 1. Prevê o r de Pearson para esses mesmos pontos.Mostrar a resposta
0.9382, comR² = 0.8803— alto, e nem perto do 1 que o ρ indica. O desenvolvimento do ρ mostra porque é exactamente 1: as ordens de x e de y coincidem posição a posição, logoΣd² = 0e a fórmula reduz-se a1 − 0. Pearson não mede a ordem, mede a rectidão, e estes pontos curvam. Perfeitamente ordenado e perfeitamente linear são propriedades diferentes, e este conjunto de dados separa-as. -
O mesmo predefinido. O aviso por baixo assinala o ponto
(6, 28)como de alta influência, D de Cook ≈1.7931. Esse ponto é um erro?Mostrar a resposta
Não — é tão sólido como qualquer outro ponto aqui. O D de Cook mede quanto se deslocaria a recta ajustada se um ponto fosse retirado, não se o ponto está certo, e este desloca muito a recta por uma razão que nada tem a ver com a qualidade dos dados: a tendência curva, o ajuste é recto, e o ponto mais afastado ao longo dessa curva é aquele com que uma recta mais se atrapalha. A influência descreve uma posição, nunca um erro. -
Carrega em Sem correlação — uma nuvem sem qualquer tendência visível. A página recusa-se a ajustar uma recta?
Mostrar a resposta
Nunca se recusa. Saiŷ = 4 + 0.1429·x, impresso exactamente com a confiança de qualquer outro ajuste, e sóR² = 0.0137e a nota que diz correlação fraca sugerem outra coisa. Os mínimos quadrados devolvem sempre a melhor recta disponível; o método não tem noção de “aqui não há relação nenhuma”, apenas de “o menor total de distâncias ao quadrado”. Se uma recta fazia sentido é juízo teu, e nada no resultado o fará por ti.
Problema resolvido na íntegra
-
Derivação do declive e da ordenada na origem para y = 0,87 + 1,03x 5 passos
Cinco pontos e uma reta de melhor ajustamento de y = 0,87 + 1,03x com R² = 0,996. Deduza o declive e a ordenada na origem a partir do zero e, em seguida, prove uma propriedade de todas as retas dos mínimos quadrados que o painel nunca menciona.
-
As médias vêm em primeiro lugar, porque ambos os coeficientes são construídos a partir dos desvios em relação a elas.
-
Os mínimos quadrados minimizam a soma dos quadrados dos resíduos verticais. Derivando essa soma e igualando-a a zero obtêm-se as equações normais, cuja solução é uma razão de duas somas: como x e y variam em conjunto, sobre como x varia isoladamente.
-
O declive é 1,03. A ordenada na origem decorre então sem qualquer minimização adicional, porque a segunda equação normal é simplesmente o requisito de que os resíduos somem zero.
-
A correlação utiliza as mesmas duas somas mais a variação em y. Elevando-a ao quadrado obtém-se R² = 0,996, a proporção da variação de y que a reta explica.
-
Agora a propriedade. A ordenada na origem foi definida como ȳ − b·x̄, pelo que substituir x̄ de novo na reta devolve exatamente ȳ.
Resposta
A ferramenta apresenta um declive de 1,03, uma ordenada na origem de 0,87, R² = 0,996 e r = 0,998. O facto estrutural surge no último passo: toda a reta de mínimos quadrados passa pelo ponto médio dos dados, quaisquer que sejam os pontos. Esta não é uma propriedade deste conjunto de dados, mas uma consequência da fórmula da ordenada na origem; é por isso que, ao arrastar um ponto, a reta de regressão roda em torno do centroide em vez de se deslocar por inteiro. É também a forma mais rápida de verificar se uma reta ajustada faz sentido: substitua x pela sua média; se não obtiver a média de y, o ajuste está errado. Experimente a predefinição com o valor atípico. A ferramenta apresenta um novo conjunto de dados: cinco pontos exatamente sobre y = 2x e um sexto em (6; 30). Esse sexto ponto faz o declive passar de 2 para 4,57 e leva a ordenada na origem a −6, mas a reta continua a passar exatamente pelo novo ponto médio, (3,5; 10).
-
Percurso de aprendizagem
Ajustar uma reta aos dados
Referências (1)
- Who invented least squares, and the long argument about it — Legendre published first, Gauss claimed priority: S. M. Stigler, “Gauss and the Invention of Least Squares.” The Annals of Statistics 9, 1981.