Explorateur de géométrie des moindres carrés

Ajustez des données réelles avec une droite ou une courbe, puis examinez les résidus que la méthode des moindres carrés cherche à réduire.

Chargement de la simulation interactive...

Leçon

La théorie — Explorateur de géométrie des moindres carrés

“Moindres carrés” désigne ce qui est minimisé : la somme des carrés des résidus. Géométriquement, les valeurs ajustées constituent le point le plus proche de vos données au sein de l'ensemble des courbes que le modèle peut produire — le plus proche au sens usuel de la distance en ligne droite, c'est pourquoi le vecteur des résidus restant se retrouve perpendiculaire à tout ce que le modèle aurait pu produire.

Ce que signifie chaque symbole

residual
un écart entre un point de donnée et la courbe ajustée, mesuré verticalement. L'affichage les liste tous avant de les élever au carré.
SSE
la somme des carrés des erreurs — additionnez les carrés de tous les résidus. 1.3714 pour l'ajustement linéaire ici.
RMSE
la racine de l'erreur quadratique moyenne, √(SSE/n) = 0.4781. Contrairement à la SSE, elle s'exprime dans la même unité que y, c'est donc elle qu'il convient de citer.
model
la famille de courbes autorisées. Passer de droite à quadratique élargit cette famille de deux paramètres libres à trois.

D’où vient la formule

  1. Chaque courbe candidate produit une liste de valeurs ajustées. Considérez cette liste comme un point unique dans un espace à n dimensions, et vos données comme un autre point dans cet espace.
  2. La SSE est alors littéralement le carré de la distance entre ces deux points. Minimiser la SSE revient à trouver le point accessible le plus proche des données — une projection, et non une recherche.
  3. Et la propriété caractéristique d'une projection est que l'erreur est perpendiculaire à tout ce qui est accessible. C'est pourquoi la somme des résidus du meilleur ajustement est toujours nulle et ne présente aucune corrélation résiduelle avec x : un tel motif constituerait une direction dans laquelle le modèle aurait encore pu se déplacer.

Comment lire ce que vous voyez

Le nombre de points, puis le modèle ajusté détaillé, puis la SSE présentée terme à terme — −0.7143² + 0.3714² + 0.4571² + ⋯ = 1.3714 — afin que vous puissiez voir quel point dégrade l'ajustement avant que les carrés ne masquent les signes. La RMSE vient en dernier comme résumé lisible par l'utilisateur.

Suppose
Uniquement des écarts verticaux, de sorte que x est considéré comme exact et que chaque point est pondéré de manière égale. Le modèle doit également être linéaire par rapport à ses paramètres — ce qui reste le cas d'une fonction quadratique, malgré la courbe, car intervient multiplié par une constante.
Ne tient plus quand
Une SSE plus faible ne signifie pas un meilleur modèle, et vous pouvez le prouver ici en un clic. Passez de la droite à la quadratique et la SSE chute de 1.3714 à 0.4071 — elle allait forcément diminuer, car une fonction quadratique contient chaque droite comme cas particulier où le coefficient de est nul. Un modèle disposant de plus de liberté ne peut pas offrir un moins bon ajustement, de sorte que la SSE seule ne pourra jamais vous indiquer si le terme supplémentaire est réel ou s'il ajuste du bruit.

La droite d’ajustement passe toujours par le point moyen 🖖

Quelles que soient vos données, la droite des moindres carrés passe forcément par (x̄, ȳ), le point formé de la moyenne des x et de la moyenne des y. Ce n’est pas une tendance : cela découle directement de la condition selon laquelle les résidus se somment à zéro, et vaut donc sans exception pour tout jeu de données. Vous obtenez ainsi une vérification gratuite : marquez le point moyen, et toute droite candidate qui le manque n’est pas l’ajustement des moindres carrés. Cela explique aussi la faiblesse de la méthode. Comme les écarts sont élevés au carré, un point deux fois plus loin tire quatre fois plus fort : une seule valeur aberrante peut faire pivoter la droite davantage qu’une douzaine de points sages ne la retiennent.

Pourquoi on élève les écarts au carré 🖖

L'outil additionne les carrés des écarts verticaux entre chaque point et la droite, puis cherche la droite qui rend ce total aussi petit que possible. Comme on élève au carré, un écart deux fois plus grand compte quatre fois plus, si bien que l'ajustement s'efforce d'éviter le moindre gros écart isolé. Faites glisser un point au loin et observez toute la droite se précipiter vers lui : cette attraction est le prix direct du carré.

La régression n'est pas symétrique 🖖

Comme la méthode des moindres carrés ne réduit que les écarts verticaux, elle suppose en silence que y est la cible et que x est exact. Échangez les axes et réajustez : vous obtenez une droite différente, pas l'image miroir attendue. Les deux droites passent par le point moyen des données (x̄, ȳ), mais elles ne coïncident que si les points sont exactement alignés. Les deux pentes, multipliées, donnent même r², le carré de la corrélation.

Exercice

Vérifiez-vous

Prédisez d’abord la réponse, puis utilisez les commandes ci-dessus pour vérifier. N’affichez la solution qu’après vous être engagé sur une hypothèse : c’est ce qui en fait un exercice.

  1. Appuyez sur freinage avec droite : six points, un ajustement rectiligne, SCE 84. Appuyez maintenant sur freinage avec courbe — les mêmes six points, ajustés par une fonction quadratique. Prédisez la nouvelle SCE.

    Afficher la réponse
    0. Pas presque nulle : nulle, avec un RMSE de 0 et la courbe ajustée ŷ = 8 − 0.25x + 0.015x². Ces six points sortent exactement de cette parabole, et dès que la famille de courbes autorisée contient la vérité, il ne reste plus rien à élever au carré. Une SCE qui baisse ne prouve rien en soi — une famille plus large ne peut jamais ajuster moins bien. Une chute jusqu'au plancher est d'une autre nature, car il ne reste aucun résidu qu'un modèle supplémentaire pourrait retirer.
  2. Appuyez sur rétention du cours, ajustée par une droite avec une SCE de 1.3714 et une part de SCE du point le plus influent de 37.2%. Passez le sélecteur de modèle sur Quadratique. La SCE va baisser — prédisez ce que fait cette part.

    Afficher la réponse
    Elle monte, à 56.3%, tandis que la SCE tombe à 0.4071. Une part n'est pas un montant : la liberté supplémentaire a tiré la courbe vers les points qu'elle pouvait atteindre, si bien que celui qu'elle n'atteint toujours pas occupe maintenant une plus grande fraction d'un total plus petit. Un avertissement pendant que vous y êtes — appuyer sur n'importe quel préréglage remet le sélecteur sur Droite, ces nombres ne veulent donc dire cela que tant que Quadratique reste affiché.
  3. Retour à freinage avec droite. L'affichage montre cinq des six résidus avant son : 5, −1, −4, −4, −1. Que vaut le sixième, et que vous disent les six ensemble que la SCE 84 ne dit pas ?

    Afficher la réponse
    +5. Les résidus d'un ajustement par moindres carrés ont toujours une somme nulle, et les cinq affichés donnent −5 : le manquant est donc forcé. Le graphique des résidus dessine exactement cette forme : deux hautes barres vers le haut aux extrémités, quatre plongeant vers le bas au milieu, un U bien net. Avoir une somme nulle et ne laisser aucune inclinaison contre x, c'est tout ce que les moindres carrés garantissent, et un U symétrique remplit les deux conditions — ses résidus ont bien une somme nulle, et il ne penche d'aucun côté — une droite ne peut donc ni l'absorber ni le remarquer. La SCE dit que l'ajustement est lâche ; seule la forme dit qu'il est lâche dans une direction à la fois.

Problème entièrement résolu

  1. Six points avec une somme des carrés des erreurs de 1,3714 5 étapes

    Six points, une droite d'ajustement et une somme des carrés des erreurs de 1,3714. Déterminez quelle part de ce total provient d'un seul point — et prouvez une propriété des résidus qui s'applique à tout ajustement par les moindres carrés jamais calculé.

    1. Les coefficients proviennent des deux mêmes sommes que pour n'importe quelle régression simple : la façon dont x et y varient ensemble, rapportée à la façon dont x varie seul.

    2. Cela donne la droite affichée par le panneau. Ces données n'ont rien de particulier — il s'agit d'un alignement presque droit de six points avec une légère dispersion.

    3. Les résidus représentent ce que l'ajustement n'a pas pu expliquer. Calculez les six résidus et l'un d'eux saute aux yeux : le point situé en x = 0 présente un écart de −0,7143, soit environ le double de l'erreur typique.

    4. Avant de les utiliser, remarquez que leur somme est nulle — pas approximativement, mais exactement. Cela est imposé par l'ordonnée à l'origine : la seconde équation normale est l'affirmation selon laquelle la moyenne des résidus est nulle, ce qui est donc vrai pour toute droite des moindres carrés, quelles que soient les données.

    5. L'élévation au carré détruit cet équilibre, et c'est bien là l'enjeu. Le −0,7143 devient 0,5102, ce qui représente 37,2 % de la SSE totale de 1,3714 — un seul point sur six portant plus d'un tiers de la pénalité.

    Réponse

    L'outil affiche SSE = 1,3714, RMSE = 0,4781 et une part pour le point le plus éloigné de 37,2 %. Ces deux faits ont leur importance et s'opposent. La somme nulle des résidus indique que la droite est équilibrée ; les 37,2 % indiquent que l'ajustement ne l'est pas, car l'élévation au carré pondère une erreur double quatre fois plus lourdement. C'est précisément pour cela que les moindres carrés sont si sensibles aux valeurs aberrantes, et pourquoi la propriété de somme nulle des résidus ne constitue aucune protection : un seul point aberrant ne peut pas modifier le résidu moyen, mais peut tout de même dominer ce que la droite cherche à minimiser.

Parcours

Ajuster une droite à des données

Mène à Régression linéaire la droite d'ajustement vue comme une projection, et la raison pour laquelle ses résidus sont orthogonaux au modèle.

Références (1)
  • Least squares as an orthogonal projection, which is what makes the residuals perpendicular to the model: G. Strang, Introduction to Linear Algebra, 5th ed., chapter 4 (“Orthogonality”). Wellesley-Cambridge Press, 2016. ISBN 978-0-9802327-7-6.

Exemples de problèmes

  • rétention du cours - Six points, une SSE de 1,3714 et un R² de 0,9978. Il s’agit des données de l’exercice corrigé. La droite y = 42,71 + 5,91x passe par le point moyen (2,5 ; 57,5).
  • valeur aberrante de campagne - Les cinq premiers points sont exactement alignés sur une droite de pente 5. Le sixième porte la pente ajustée à 8,54 et représente à lui seul 47,5 % de la SSE : un point sur six concentre près de la moitié de l’erreur.
  • freinage avec droite - Une droite ajustée à des données paraboliques : une SSE de 84,0 et un R² de 0,9618. Le résultat paraît honorable, jusqu’à ce que vous examiniez les résidus. Ils dessinent une courbe au lieu de se disperser.
  • freinage avec courbe - Les mêmes six points, ajustés par un modèle quadratique : y = 8 - 0,25x + 0,015x². La SSE vaut exactement 0. Au dernier chiffre près, les données sont sur cette parabole, là où la droite laissait une SSE de 84.
  • prix immobiliers - Sept appartements à 2,74 milliers par mètre carré, avec un R² de 0,998 et une SSE de 88,39. Des données d’apparence réelle, mais encore presque parfaitement alignées.