Regressão Linear

Insira pontos de dados e veja a reta de melhor ajuste, os resíduos e as estatísticas de correlação.

A carregar a simulação interativa...

Lição

A teoria — Regressão Linear

A reta dos mínimos quadrados é a única reta que torna a soma dos desvios verticais ao quadrado entre os pontos e a reta o menor possível. Ao quadrado por duas razões: para que os desvios acima e abaixo não se anulem mutuamente, e para que um desvio grande conte mais do que vários pequenos.

O que significa cada símbolo

b
o declive — quanto y varia por cada unidade de x.
a
a ordenada na origem — o valor ajustado de y quando x = 0, quer x = 0 esteja ou não perto dos dados.
ŷ
um valor ajustado: o que a reta prevê para um dado x. O chapéu distingue-o de um y observado.
a proporção da variação em y explicada pela reta, entre 0 e 1.
r
o r de Pearson, a correlação — a mesma informação que , mas com sinal, pelo que inclui também a direção.

De onde vem a fórmula

  1. Escreva a quantidade a minimizar: S = Σ(y − a − b·x)², somada para todos os pontos.
  2. S é uma função suave de a e b, pelo que no seu mínimo ambas as derivadas parciais são zero. Igualando-as a zero obtêm-se duas equações lineares em a e b — as equações normais.
  3. Resolvendo estas equações em ordem ao declive obtém-se b = (n·Σxy − Σx·Σy) / (n·Σx² − (Σx)²) — a fórmula apresentada acima com as cinco somas substituídas: (5·69.7 − 15·19.8) / (5·55 − 15²) = 51.5 / 50 = 1.03.
Pressupõe
Que uma reta é o modelo adequado à partida, e que todo o erro reside em y: são os desvios verticais que são minimizados, pelo que x é tratado como sendo exatamente conhecido. Todos os pontos têm também o mesmo peso, por mais afastados que estejam dos restantes.
Falha quando
A reta não faz ideia de onde terminam os seus dados. Os pontos por omissão vão de x = 1 a x = 5; peça uma previsão para x = 6 e ela devolve ŷ(6) = 7.05 sem o mínimo aviso de que está agora a extrapolar para além de todas as observações em que se baseou. Um elevado também não é garantia de nada — mede o quão bem a reta se ajusta aos dados, mas nunca se uma reta era o modelo adequado a ajustar.

por que um único ponto pode sequestrar toda a reta 🖖

Os mínimos quadrados minimizam a soma dos quadrados dos resíduos, então um ponto distante da tendência é penalizado de forma quadrática — ele puxa a reta para si muito mais do que um ponto comum. A distância de Cook mede exatamente isso: o quanto a reta ajustada mudaria se esse ponto fosse removido. Um R² alto também pode esconder isso — um único ponto influente pode inflar a correlação mesmo quando o restante da nuvem é quase não correlacionado. Arraste o ponto marcado para fora e observe a inclinação segui-lo.

o que a reta de melhor ajuste realmente faz 🖖

A ferramenta traça a única reta que fica mais próxima de todos os seus pontos ao mesmo tempo. "Mais próxima" significa a menor soma das distâncias verticais ao quadrado entre cada ponto e a reta — essas distâncias são os resíduos, mostrados como pequenos segmentos. O R² então indica quanto da variação em y a reta explica: R² = 0.8 significa que a reta explica 80% da dispersão, deixando 20% sem explicação.

troque os eixos e a reta se desloca 🖖

Ajustar y a partir de x minimiza as distâncias verticais, mas ajustar x a partir de y minimiza as horizontais — duas retas diferentes na mesma nuvem, embora ambas passem pelo ponto médio (x̄, ȳ). Multiplique as duas inclinações e você obtém exatamente r². Assim, o conhecido r é a média geométrica das duas inclinações de regressão, e as retas só coincidem quando o ajuste é perfeito (r = 1).

Prática

Verifique você mesmo

Preveja primeiro a resposta e depois use os controlos acima para confirmar. Revele a solução só depois de se ter comprometido com um palpite — é isso que torna isto prática.

  1. Carrega em Spearman ρ=1: os pontos 1, 2.5, 5, 9, 16, 28 sobem a cada passo, e o nome do predefinido já denuncia que ρ = 1. Prevê o r de Pearson para esses mesmos pontos.

    Mostrar a resposta
    0.9382, com R² = 0.8803 — alto, e nem perto do 1 que o ρ indica. O desenvolvimento do ρ mostra porque é exactamente 1: as ordens de x e de y coincidem posição a posição, logo Σd² = 0 e a fórmula reduz-se a 1 − 0. Pearson não mede a ordem, mede a rectidão, e estes pontos curvam. Perfeitamente ordenado e perfeitamente linear são propriedades diferentes, e este conjunto de dados separa-as.
  2. O mesmo predefinido. O aviso por baixo assinala o ponto (6, 28) como de alta influência, D de Cook ≈ 1.7931. Esse ponto é um erro?

    Mostrar a resposta
    Não — é tão sólido como qualquer outro ponto aqui. O D de Cook mede quanto se deslocaria a recta ajustada se um ponto fosse retirado, não se o ponto está certo, e este desloca muito a recta por uma razão que nada tem a ver com a qualidade dos dados: a tendência curva, o ajuste é recto, e o ponto mais afastado ao longo dessa curva é aquele com que uma recta mais se atrapalha. A influência descreve uma posição, nunca um erro.
  3. Carrega em Sem correlação — uma nuvem sem qualquer tendência visível. A página recusa-se a ajustar uma recta?

    Mostrar a resposta
    Nunca se recusa. Sai ŷ = 4 + 0.1429·x, impresso exactamente com a confiança de qualquer outro ajuste, e só R² = 0.0137 e a nota que diz correlação fraca sugerem outra coisa. Os mínimos quadrados devolvem sempre a melhor recta disponível; o método não tem noção de “aqui não há relação nenhuma”, apenas de “o menor total de distâncias ao quadrado”. Se uma recta fazia sentido é juízo teu, e nada no resultado o fará por ti.

Problema resolvido na íntegra

  1. Derivação do declive e da ordenada na origem para y = 0,87 + 1,03x 5 passos

    Cinco pontos e uma reta de melhor ajustamento de y = 0,87 + 1,03x com R² = 0,996. Deduza o declive e a ordenada na origem a partir do zero e, em seguida, prove uma propriedade de todas as retas dos mínimos quadrados que o painel nunca menciona.

    1. As médias vêm em primeiro lugar, porque ambos os coeficientes são construídos a partir dos desvios em relação a elas.

    2. Os mínimos quadrados minimizam a soma dos quadrados dos resíduos verticais. Derivando essa soma e igualando-a a zero obtêm-se as equações normais, cuja solução é uma razão de duas somas: como x e y variam em conjunto, sobre como x varia isoladamente.

    3. O declive é 1,03. A ordenada na origem decorre então sem qualquer minimização adicional, porque a segunda equação normal é simplesmente o requisito de que os resíduos somem zero.

    4. A correlação utiliza as mesmas duas somas mais a variação em y. Elevando-a ao quadrado obtém-se R² = 0,996, a proporção da variação de y que a reta explica.

    5. Agora a propriedade. A ordenada na origem foi definida como ȳ − b·x̄, pelo que substituir x̄ de novo na reta devolve exatamente ȳ.

    Resposta

    A ferramenta apresenta um declive de 1,03, uma ordenada na origem de 0,87, R² = 0,996 e r = 0,998. O facto estrutural surge no último passo: toda a reta de mínimos quadrados passa pelo ponto médio dos dados, quaisquer que sejam os pontos. Esta não é uma propriedade deste conjunto de dados, mas uma consequência da fórmula da ordenada na origem; é por isso que, ao arrastar um ponto, a reta de regressão roda em torno do centroide em vez de se deslocar por inteiro. É também a forma mais rápida de verificar se uma reta ajustada faz sentido: substitua x pela sua média; se não obtiver a média de y, o ajuste está errado. Experimente a predefinição com o valor atípico. A ferramenta apresenta um novo conjunto de dados: cinco pontos exatamente sobre y = 2x e um sexto em (6; 30). Esse sexto ponto faz o declive passar de 2 para 4,57 e leva a ordenada na origem a −6, mas a reta continua a passar exatamente pelo novo ponto médio, (3,5; 10).

Percurso de aprendizagem

Ajustar uma reta aos dados

Referências (1)

Problemas de exemplo