Régression linéaire

Saisissez des points de données et observez la droite d'ajustement optimal, les résidus et les statistiques de corrélation.

Chargement de la simulation interactive...

Leçon

La théorie — Régression linéaire

La droite des moindres carrés est la seule droite qui rend la somme des écarts verticaux au carré entre les points et la droite aussi petite que possible. Au carré pour deux raisons : afin que les écarts situés au-dessus et en dessous ne s'annulent pas, et pour qu'un seul grand écart pèse plus que plusieurs petits.

Ce que signifie chaque symbole

b
la pente — de combien y varie par unité de x.
a
l'ordonnée à l'origine — la valeur ajustée de y pour x = 0, que x = 0 soit proche ou non des données.
ŷ
une valeur ajustée : ce que la droite prédit pour un x donné. Le chapeau permet de la distinguer d'un y observé.
la part de la variation de y expliquée par la droite, comprise entre 0 et 1.
r
le r de Pearson, la corrélation — la même information que mais signée, ce qui indique aussi le sens.

D’où vient la formule

  1. Écrire la quantité à minimiser : S = Σ(y − a − b·x)², sommée sur l'ensemble des points.
  2. S est une fonction régulière de a et b, donc à son minimum, les deux dérivées partielles sont nulles. Les égaler à zéro donne deux équations linéaires en a et b — les équations normales.
  3. En les résolvant pour la pente, on obtient b = (n·Σxy − Σx·Σy) / (n·Σx² − (Σx)²) — la formule affichée ci-dessus dans laquelle ont été remplacées les cinq sommes : (5·69.7 − 15·19.8) / (5·55 − 15²) = 51.5 / 50 = 1.03.
Suppose
Qu'une droite soit le bon modèle au départ, et que toute l'erreur réside dans y : ce me sont les écarts verticaux qui sont minimisés, donc x est considéré comme connu exactement. Chaque point a également le même poids, quelle que soit sa distance par rapport aux autres.
Ne tient plus quand
La droite n'a aucune idée de là où s'arrêtent vos données. Les points par défaut vont de x = 1 à x = 5 ; si vous demandez une prédiction pour x = 6, elle renvoie ŷ(6) = 7.05 sans protester qu'elle extrapole désormais au-delà de toutes les observations ayant servi à la construire. Un élevé n'est pas non plus une garantie — il mesure la qualité de l'ajustement d'une droite, jamais si une droite était le modèle approprié.

pourquoi un seul point peut détourner toute la droite 🖖

Les moindres carrés minimisent la somme des carrés des résidus, donc un point éloigné de la tendance est pénalisé de façon quadratique — il attire la droite vers lui bien plus qu'un point ordinaire. La distance de Cook mesure exactement cela : de combien la droite ajustée se déplacerait si ce point était retiré. Un R² élevé peut aussi masquer ce phénomène — un seul point influent peut gonfler la corrélation même si le reste du nuage est presque non corrélé. Faites glisser le point signalé vers l'extérieur et observez la pente le suivre.

ce que fait vraiment la droite d'ajustement 🖖

L'outil trace l'unique droite qui passe au plus près de tous vos points à la fois. "Au plus près" signifie la plus petite somme des écarts verticaux au carré entre chaque point et la droite — ces écarts sont les résidus, dessinés en petits segments. R² indique alors quelle part de la variation de y la droite explique : R² = 0.8 veut dire que la droite explique 80% de la dispersion, laissant 20% inexpliqués.

échangez les axes et la droite bouge 🖖

Ajuster y à partir de x minimise les écarts verticaux, mais ajuster x à partir de y minimise les écarts horizontaux — deux droites différentes dans le même nuage, même si les deux passent par le point moyen (x̄, ȳ). Multipliez leurs deux pentes et vous obtenez exactement r². Ainsi le r familier est la moyenne géométrique des deux pentes de régression, et les droites ne coïncident que si l'ajustement est parfait (r = 1).

Exercice

Vérifiez-vous

Prédisez d’abord la réponse, puis utilisez les commandes ci-dessus pour vérifier. N’affichez la solution qu’après vous être engagé sur une hypothèse : c’est ce qui en fait un exercice.

  1. Appuyez sur Spearman ρ=1 : les points 1, 2.5, 5, 9, 16, 28 montent à chaque pas, et le nom du préréglage annonce déjà ρ = 1. Prédisez le r de Pearson pour ces mêmes points.

    Afficher la réponse
    0.9382, avec R² = 0.8803 — élevé, et loin du 1 que rapporte ρ. Le calcul de ρ montre pourquoi il vaut exactement 1 : les rangs de x et de y coïncident position par position, donc Σd² = 0 et la formule se réduit à 1 − 0. Pearson ne mesure pas l'ordre, il mesure la rectitude, et ces points s'incurvent. Parfaitement ordonné et parfaitement linéaire sont deux propriétés différentes, et ce jeu de données les sépare.
  2. Même préréglage. L'avertissement en dessous signale le point (6, 28) comme très influent, D de Cook ≈ 1.7931. Ce point est-il une erreur ?

    Afficher la réponse
    Non — il est aussi sain que tous les autres ici. Le D de Cook mesure de combien la droite ajustée se déplacerait si l'on retirait un point, pas si le point est juste ; et celui-ci déplace beaucoup la droite pour une raison qui n'a rien à voir avec la qualité des données : la tendance s'incurve, l'ajustement est rectiligne, et le point le plus loin sur cette courbe est celui avec lequel une droite peine le plus. L'influence décrit une position, jamais une faute.
  3. Appuyez sur Aucune corrélation — un nuage sans la moindre tendance visible. La page refuse-t-elle d'ajuster une droite ?

    Afficher la réponse
    Elle ne refuse jamais. Il en sort ŷ = 4 + 0.1429·x, imprimé avec exactement l'assurance de n'importe quel autre ajustement, et seuls R² = 0.0137 et la note corrélation faible laissent entendre autre chose. Les moindres carrés renvoient toujours la meilleure droite disponible ; la méthode n'a aucune notion de « il n'y a pas de relation ici », seulement de « le plus petit total des écarts au carré ». Savoir si une droite avait sa place relève de votre jugement, et rien dans la sortie ne le fera à votre place.

Problème entièrement résolu

  1. Calcul de la pente et de l'ordonnée à l'origine pour y = 0,87 + 1,03x 5 étapes

    Cinq points, et une droite d'ajustement y = 0,87 + 1,03x avec R² = 0,996. Établissez la pente et l'ordonnée à l'origine à partir de zéro, puis prouvez une propriété de toute droite des moindres carrés que le panneau ne mentionne jamais.

    1. Les moyennes viennent en premier, car les deux coefficients sont construits à partir des écarts par rapport à celles-ci.

    2. La méthode des moindres carrés minimise la somme des carrés des résidus verticaux. Dériver cette somme et l'égaler à zéro donne les équations normales, dont la solution est le rapport de deux sommes : la façon dont x et y varient ensemble, sur la façon dont x varie seul.

    3. La pente est de 1,03. L'ordonnée à l'origine s'en déduit alors sans aucune minimisation supplémentaire, car la seconde équation normale exige simplement que la somme des résidus soit nulle.

    4. La corrélation utilise ces deux mêmes sommes, plus la variation de y. Son élévation au carré donne R² = 0,996, soit la part de la variation de y expliquée par la droite.

    5. Passons à la propriété. L'ordonnée à l'origine ayant été définie par ȳ − b·x̄, réinjecter x̄ dans la droite redonne exactement ȳ.

    Réponse

    L’outil affiche une pente de 1,03, une ordonnée à l’origine de 0,87, R² = 0,996 et r = 0,998. Le fait essentiel vient à la dernière étape : toute droite des moindres carrés passe par le point moyen des données, quelle que soit la disposition des points. Ce n’est pas une propriété particulière de ce jeu de données, mais une conséquence de la formule de l’ordonnée à l’origine. Voilà pourquoi, lorsque vous déplacez un point, la droite de régression pivote autour du centre de gravité au lieu de se translater tout entière. C’est aussi le moyen le plus rapide de vérifier un ajustement : remplacez x par sa moyenne ; si vous n’obtenez pas la moyenne de y, l’ajustement est faux. Essayez le préréglage « valeur aberrante » : il charge un nouveau jeu de données composé de cinq points situés exactement sur la droite y = 2x et d’un sixième point en (6, 30). Celui-ci fait passer la pente de 2 à 4,57 et l’ordonnée à l’origine à −6, tandis que la droite continue de passer exactement par le nouveau point moyen, (3,5, 10).

Parcours

Ajuster une droite à des données

Références (1)

Exemples de problèmes