Leçon
La théorie — Régression linéaire
La droite des moindres carrés est la seule droite qui rend la somme des écarts verticaux au carré entre les points et la droite aussi petite que possible. Au carré pour deux raisons : afin que les écarts situés au-dessus et en dessous ne s'annulent pas, et pour qu'un seul grand écart pèse plus que plusieurs petits.
Ce que signifie chaque symbole
b- la pente — de combien y varie par unité de x.
a- l'ordonnée à l'origine — la valeur ajustée de y pour
x = 0, quex = 0soit proche ou non des données. ŷ- une valeur ajustée : ce que la droite prédit pour un x donné. Le chapeau permet de la distinguer d'un y observé.
R²- la part de la variation de y expliquée par la droite, comprise entre 0 et 1.
r- le r de Pearson, la corrélation — la même information que
R²mais signée, ce qui indique aussi le sens.
D’où vient la formule
- Écrire la quantité à minimiser :
S = Σ(y − a − b·x)², sommée sur l'ensemble des points. Sest une fonction régulière de a et b, donc à son minimum, les deux dérivées partielles sont nulles. Les égaler à zéro donne deux équations linéaires en a et b — les équations normales.- En les résolvant pour la pente, on obtient
b = (n·Σxy − Σx·Σy) / (n·Σx² − (Σx)²)— la formule affichée ci-dessus dans laquelle ont été remplacées les cinq sommes :(5·69.7 − 15·19.8) / (5·55 − 15²) = 51.5 / 50 = 1.03.
- Suppose
- Qu'une droite soit le bon modèle au départ, et que toute l'erreur réside dans y : ce me sont les écarts verticaux qui sont minimisés, donc x est considéré comme connu exactement. Chaque point a également le même poids, quelle que soit sa distance par rapport aux autres.
- Ne tient plus quand
- La droite n'a aucune idée de là où s'arrêtent vos données. Les points par défaut vont de
x = 1àx = 5; si vous demandez une prédiction pourx = 6, elle renvoieŷ(6) = 7.05sans protester qu'elle extrapole désormais au-delà de toutes les observations ayant servi à la construire. UnR²élevé n'est pas non plus une garantie — il mesure la qualité de l'ajustement d'une droite, jamais si une droite était le modèle approprié.
Exercice
Vérifiez-vous
Prédisez d’abord la réponse, puis utilisez les commandes ci-dessus pour vérifier. N’affichez la solution qu’après vous être engagé sur une hypothèse : c’est ce qui en fait un exercice.
-
Appuyez sur Spearman ρ=1 : les points
1, 2.5, 5, 9, 16, 28montent à chaque pas, et le nom du préréglage annonce déjàρ = 1. Prédisez le r de Pearson pour ces mêmes points.Afficher la réponse
0.9382, avecR² = 0.8803— élevé, et loin du 1 que rapporte ρ. Le calcul de ρ montre pourquoi il vaut exactement 1 : les rangs de x et de y coïncident position par position, doncΣd² = 0et la formule se réduit à1 − 0. Pearson ne mesure pas l'ordre, il mesure la rectitude, et ces points s'incurvent. Parfaitement ordonné et parfaitement linéaire sont deux propriétés différentes, et ce jeu de données les sépare. -
Même préréglage. L'avertissement en dessous signale le point
(6, 28)comme très influent, D de Cook ≈1.7931. Ce point est-il une erreur ?Afficher la réponse
Non — il est aussi sain que tous les autres ici. Le D de Cook mesure de combien la droite ajustée se déplacerait si l'on retirait un point, pas si le point est juste ; et celui-ci déplace beaucoup la droite pour une raison qui n'a rien à voir avec la qualité des données : la tendance s'incurve, l'ajustement est rectiligne, et le point le plus loin sur cette courbe est celui avec lequel une droite peine le plus. L'influence décrit une position, jamais une faute. -
Appuyez sur Aucune corrélation — un nuage sans la moindre tendance visible. La page refuse-t-elle d'ajuster une droite ?
Afficher la réponse
Elle ne refuse jamais. Il en sortŷ = 4 + 0.1429·x, imprimé avec exactement l'assurance de n'importe quel autre ajustement, et seulsR² = 0.0137et la note corrélation faible laissent entendre autre chose. Les moindres carrés renvoient toujours la meilleure droite disponible ; la méthode n'a aucune notion de « il n'y a pas de relation ici », seulement de « le plus petit total des écarts au carré ». Savoir si une droite avait sa place relève de votre jugement, et rien dans la sortie ne le fera à votre place.
Problème entièrement résolu
-
Calcul de la pente et de l'ordonnée à l'origine pour y = 0,87 + 1,03x 5 étapes
Cinq points, et une droite d'ajustement y = 0,87 + 1,03x avec R² = 0,996. Établissez la pente et l'ordonnée à l'origine à partir de zéro, puis prouvez une propriété de toute droite des moindres carrés que le panneau ne mentionne jamais.
-
Les moyennes viennent en premier, car les deux coefficients sont construits à partir des écarts par rapport à celles-ci.
-
La méthode des moindres carrés minimise la somme des carrés des résidus verticaux. Dériver cette somme et l'égaler à zéro donne les équations normales, dont la solution est le rapport de deux sommes : la façon dont x et y varient ensemble, sur la façon dont x varie seul.
-
La pente est de 1,03. L'ordonnée à l'origine s'en déduit alors sans aucune minimisation supplémentaire, car la seconde équation normale exige simplement que la somme des résidus soit nulle.
-
La corrélation utilise ces deux mêmes sommes, plus la variation de y. Son élévation au carré donne R² = 0,996, soit la part de la variation de y expliquée par la droite.
-
Passons à la propriété. L'ordonnée à l'origine ayant été définie par ȳ − b·x̄, réinjecter x̄ dans la droite redonne exactement ȳ.
Réponse
L’outil affiche une pente de 1,03, une ordonnée à l’origine de 0,87, R² = 0,996 et r = 0,998. Le fait essentiel vient à la dernière étape : toute droite des moindres carrés passe par le point moyen des données, quelle que soit la disposition des points. Ce n’est pas une propriété particulière de ce jeu de données, mais une conséquence de la formule de l’ordonnée à l’origine. Voilà pourquoi, lorsque vous déplacez un point, la droite de régression pivote autour du centre de gravité au lieu de se translater tout entière. C’est aussi le moyen le plus rapide de vérifier un ajustement : remplacez x par sa moyenne ; si vous n’obtenez pas la moyenne de y, l’ajustement est faux. Essayez le préréglage « valeur aberrante » : il charge un nouveau jeu de données composé de cinq points situés exactement sur la droite y = 2x et d’un sixième point en (6, 30). Celui-ci fait passer la pente de 2 à 4,57 et l’ordonnée à l’origine à −6, tandis que la droite continue de passer exactement par le nouveau point moyen, (3,5, 10).
-
Parcours
Ajuster une droite à des données
Références (1)
- Who invented least squares, and the long argument about it — Legendre published first, Gauss claimed priority: S. M. Stigler, “Gauss and the Invention of Least Squares.” The Annals of Statistics 9, 1981.