Leçon
La théorie — Explorateur de géométrie des moindres carrés
“Moindres carrés” désigne ce qui est minimisé : la somme des carrés des résidus. Géométriquement, les valeurs ajustées constituent le point le plus proche de vos données au sein de l'ensemble des courbes que le modèle peut produire — le plus proche au sens usuel de la distance en ligne droite, c'est pourquoi le vecteur des résidus restant se retrouve perpendiculaire à tout ce que le modèle aurait pu produire.
Ce que signifie chaque symbole
residual- un écart entre un point de donnée et la courbe ajustée, mesuré verticalement. L'affichage les liste tous avant de les élever au carré.
SSE- la somme des carrés des erreurs — additionnez les carrés de tous les résidus.
1.3714pour l'ajustement linéaire ici. RMSE- la racine de l'erreur quadratique moyenne,
√(SSE/n) = 0.4781. Contrairement à la SSE, elle s'exprime dans la même unité que y, c'est donc elle qu'il convient de citer. model- la famille de courbes autorisées. Passer de droite à quadratique élargit cette famille de deux paramètres libres à trois.
D’où vient la formule
- Chaque courbe candidate produit une liste de valeurs ajustées. Considérez cette liste comme un point unique dans un espace à n dimensions, et vos données comme un autre point dans cet espace.
- La SSE est alors littéralement le carré de la distance entre ces deux points. Minimiser la SSE revient à trouver le point accessible le plus proche des données — une projection, et non une recherche.
- Et la propriété caractéristique d'une projection est que l'erreur est perpendiculaire à tout ce qui est accessible. C'est pourquoi la somme des résidus du meilleur ajustement est toujours nulle et ne présente aucune corrélation résiduelle avec x : un tel motif constituerait une direction dans laquelle le modèle aurait encore pu se déplacer.
Comment lire ce que vous voyez
Le nombre de points, puis le modèle ajusté détaillé, puis la SSE présentée terme à terme — −0.7143² + 0.3714² + 0.4571² + ⋯ = 1.3714 — afin que vous puissiez voir quel point dégrade l'ajustement avant que les carrés ne masquent les signes. La RMSE vient en dernier comme résumé lisible par l'utilisateur.
- Suppose
- Uniquement des écarts verticaux, de sorte que x est considéré comme exact et que chaque point est pondéré de manière égale. Le modèle doit également être linéaire par rapport à ses paramètres — ce qui reste le cas d'une fonction quadratique, malgré la courbe, car
x²intervient multiplié par une constante. - Ne tient plus quand
- Une SSE plus faible ne signifie pas un meilleur modèle, et vous pouvez le prouver ici en un clic. Passez de la droite à la quadratique et la SSE chute de
1.3714à0.4071— elle allait forcément diminuer, car une fonction quadratique contient chaque droite comme cas particulier où le coefficient dex²est nul. Un modèle disposant de plus de liberté ne peut pas offrir un moins bon ajustement, de sorte que la SSE seule ne pourra jamais vous indiquer si le terme supplémentaire est réel ou s'il ajuste du bruit.
Exercice
Vérifiez-vous
Prédisez d’abord la réponse, puis utilisez les commandes ci-dessus pour vérifier. N’affichez la solution qu’après vous être engagé sur une hypothèse : c’est ce qui en fait un exercice.
-
Appuyez sur freinage avec droite : six points, un ajustement rectiligne, SCE
84. Appuyez maintenant sur freinage avec courbe — les mêmes six points, ajustés par une fonction quadratique. Prédisez la nouvelle SCE.Afficher la réponse
0. Pas presque nulle : nulle, avec un RMSE de0et la courbe ajustéeŷ = 8 − 0.25x + 0.015x². Ces six points sortent exactement de cette parabole, et dès que la famille de courbes autorisée contient la vérité, il ne reste plus rien à élever au carré. Une SCE qui baisse ne prouve rien en soi — une famille plus large ne peut jamais ajuster moins bien. Une chute jusqu'au plancher est d'une autre nature, car il ne reste aucun résidu qu'un modèle supplémentaire pourrait retirer. -
Appuyez sur rétention du cours, ajustée par une droite avec une SCE de
1.3714et une part de SCE du point le plus influent de37.2%. Passez le sélecteur de modèle sur Quadratique. La SCE va baisser — prédisez ce que fait cette part.Afficher la réponse
Elle monte, à56.3%, tandis que la SCE tombe à0.4071. Une part n'est pas un montant : la liberté supplémentaire a tiré la courbe vers les points qu'elle pouvait atteindre, si bien que celui qu'elle n'atteint toujours pas occupe maintenant une plus grande fraction d'un total plus petit. Un avertissement pendant que vous y êtes — appuyer sur n'importe quel préréglage remet le sélecteur sur Droite, ces nombres ne veulent donc dire cela que tant que Quadratique reste affiché. -
Retour à freinage avec droite. L'affichage montre cinq des six résidus avant son
⋯:5,−1,−4,−4,−1. Que vaut le sixième, et que vous disent les six ensemble que la SCE84ne dit pas ?Afficher la réponse
+5. Les résidus d'un ajustement par moindres carrés ont toujours une somme nulle, et les cinq affichés donnent−5: le manquant est donc forcé. Le graphique des résidus dessine exactement cette forme : deux hautes barres vers le haut aux extrémités, quatre plongeant vers le bas au milieu, un U bien net. Avoir une somme nulle et ne laisser aucune inclinaison contre x, c'est tout ce que les moindres carrés garantissent, et un U symétrique remplit les deux conditions — ses résidus ont bien une somme nulle, et il ne penche d'aucun côté — une droite ne peut donc ni l'absorber ni le remarquer. La SCE dit que l'ajustement est lâche ; seule la forme dit qu'il est lâche dans une direction à la fois.
Problème entièrement résolu
-
Six points avec une somme des carrés des erreurs de 1,3714 5 étapes
Six points, une droite d'ajustement et une somme des carrés des erreurs de 1,3714. Déterminez quelle part de ce total provient d'un seul point — et prouvez une propriété des résidus qui s'applique à tout ajustement par les moindres carrés jamais calculé.
-
Les coefficients proviennent des deux mêmes sommes que pour n'importe quelle régression simple : la façon dont x et y varient ensemble, rapportée à la façon dont x varie seul.
-
Cela donne la droite affichée par le panneau. Ces données n'ont rien de particulier — il s'agit d'un alignement presque droit de six points avec une légère dispersion.
-
Les résidus représentent ce que l'ajustement n'a pas pu expliquer. Calculez les six résidus et l'un d'eux saute aux yeux : le point situé en x = 0 présente un écart de −0,7143, soit environ le double de l'erreur typique.
-
Avant de les utiliser, remarquez que leur somme est nulle — pas approximativement, mais exactement. Cela est imposé par l'ordonnée à l'origine : la seconde équation normale est l'affirmation selon laquelle la moyenne des résidus est nulle, ce qui est donc vrai pour toute droite des moindres carrés, quelles que soient les données.
-
L'élévation au carré détruit cet équilibre, et c'est bien là l'enjeu. Le −0,7143 devient 0,5102, ce qui représente 37,2 % de la SSE totale de 1,3714 — un seul point sur six portant plus d'un tiers de la pénalité.
Réponse
L'outil affiche SSE = 1,3714, RMSE = 0,4781 et une part pour le point le plus éloigné de 37,2 %. Ces deux faits ont leur importance et s'opposent. La somme nulle des résidus indique que la droite est équilibrée ; les 37,2 % indiquent que l'ajustement ne l'est pas, car l'élévation au carré pondère une erreur double quatre fois plus lourdement. C'est précisément pour cela que les moindres carrés sont si sensibles aux valeurs aberrantes, et pourquoi la propriété de somme nulle des résidus ne constitue aucune protection : un seul point aberrant ne peut pas modifier le résidu moyen, mais peut tout de même dominer ce que la droite cherche à minimiser.
-
Parcours
Ajuster une droite à des données
Références (1)
- Least squares as an orthogonal projection, which is what makes the residuals perpendicular to the model: G. Strang, Introduction to Linear Algebra, 5th ed., chapter 4 (“Orthogonality”). Wellesley-Cambridge Press, 2016. ISBN 978-0-9802327-7-6.