Problèmes entièrement résolus
-
Six points avec 99,49 % de la variance sur PC1 et 0,51 % sur PC2 8 étapes
Six points : (2, 1), (3, 2), (4, 2,2), (5, 3,2), (6, 3,9), (7, 5). Le panneau affiche 99,49 % de la variance sur PC1 et 0,51 % sur PC2, ce qui évoque un nuage s'apparentant essentiellement à une droite. Calculez à quelle distance de cette droite les points se situent réellement.
-
Centrez d'abord, car tout ce qui suit concerne la dispersion et non la position. Les valeurs de x vont de 2 à 7 par pas de 1, de sorte que leur moyenne se situe au milieu de l'intervalle et la colonne des x centrés est symétrique : ±0,5, ±1,5, ±2,5. Seul y nécessite du calcul.
-
La covariance divise la somme des produits par n − 1 = 5, et non par 6. Un degré de liberté a déjà été utilisé pour estimer la moyenne qui vient d'être soustraite, et avec seulement six points, cette correction représente 20 %.
-
Deux nombres suffisent pour obtenir les deux valeurs propres, et aucun des deux ne nécessite de direction. La trace est la variance totale ; le déterminant mesure à quel point la matrice est proche d'être singulière. Face à une trace de 5,581667, un déterminant de 0,156933 correspond à une matrice qui est très près d'être de rang 1.
-
Résolvez l'équation caractéristique du second degré. λ1 ressort environ 200 fois plus grande que λ2 — la forme de ce nuage condensée en une seule comparaison.
-
Les lignes de variance expliquée représentent ce rapport et rien d'autre. Ainsi, 99,49 % est une affirmation concernant λ1 et λ2, et hérite de leur nature : des variances, qui portent le carré des unités des données. Gardons cela en mémoire.
-
La direction est le vecteur propre, et pour une matrice de covariance 2×2 avec un terme hors diagonale non nul, on peut l'écrire sans rien résoudre : (λ1 − Syy, Sxy) pointe déjà le long de PC1. Normalisez-le à une longueur unitaire et vous obtenez le vecteur affiché.
-
Faites pivoter cela d'un quart de tour pour obtenir v2, puis projetez le premier point centré dessus. Le résultat, 0,031179, est le deuxième nombre du tableau des scores. Ainsi, cette colonne entière — que le panneau affiche sans jamais préciser ce qu'elle représente — est la distance signée de chaque point à la droite PC1, et le pire des six est −0,236855.
-
Venons-en maintenant à la question que les pourcentages masquaient. λ2 est une variance, c'est donc une distance au carré, et l'écart typique en est la racine carrée. Comparez cela à la racine carrée de λ1, qui est la dispersion le long de la droite.
Réponse
Les points se situent à environ 7,13 % de la longueur du nuage par rapport à la droite PC1, et non à 0,51 %. Les deux chiffres décrivent les mêmes six points ; l'un est un rapport de carrés et l'autre un rapport de longueurs, et la racine carrée entre eux représente ici un facteur de 14. Ce décalage est le piège de toute règle du type « conserver 99 % de la variance » : pour maintenir l'écart perpendiculaire sous 1 % de la dispersion, il faut que PC2 soit inférieure à 0,01 % de la variance, ce qui est cent fois plus strict que ce que laisse entendre la règle. Dans les unités des données, l'écart est √λ2 = 0,168104, et il n'est pas caché — il est tracé sur le graphique sous la forme du segment gris reliant chaque point vert à sa projection bleue, et ces segments n'ont manifestement pas une longueur nulle.
-
-
PC1 de pente 0,769 et un ajustement aux moindres carrés de 0,763 6 étapes
PC1 est affiché sous la forme (0,792687, 0,609629), une direction de pente 0,769. L'ajustement de y par rapport à x par les moindres carrés, à partir des mêmes entrées de covariance, donne 2,67/3,5 = 0,763. Deux droites à travers un même nuage de six points. Montrez laquelle est la plus raide — et qu'il s'agit toujours de celle-là.
-
Les moindres carrés sur y minimisent les écarts verticaux, et la valeur qui minimise est Sxy/Sxx. Notez ce qui se trouve au dénominateur : la dispersion de x seule. L'ajustement prend x comme une donnée et cherche seulement comment y réagit.
-
La pente de PC1 se lit directement sur le vecteur unitaire affiché, puisqu'une direction (a, b) a pour pente b/a. Elle se situe environ 6 millièmes au-dessus de la pente de régression — un écart faible, mais non nul.
-
Pour bien comparer les deux, écrivons la pente de PC1 de la façon dont le vecteur propre la définit plutôt que sous forme de rapport de décimaux. Le numérateur est le même Sxy dans les deux cas, toute la différence réside donc dans le dénominateur : Sxx pour la régression, λ1 − Syy pour PC1.
-
Développez λ1. Savoir si l'ACP a le dénominateur le plus petit devient désormais une question portant sur une unique racine carrée.
-
Et cette racine carrée est inférieure à la trace exactement lorsque le déterminant est positif, ce qui est vrai pour tout nuage qui n'est pas une droite parfaite. Le dénominateur de PC1 est donc toujours le plus petit, de sorte que PC1 est toujours la plus raide des deux. Rien de spécifique à ces six points n'a été utilisé.
-
Inversez les rôles et effectuez la régression de x sur y à la place. C'est une troisième droite, et réécrire sa pente pour la même représentation de y en fonction de x la situe à 0,779650. PC1 ne varie pas lors de cet échange — la matrice de covariance est symétrique en x et y — de sorte que l'argument de l'étape précédente s'applique maintenant en sens inverse, et PC1 est la moins raide de cette paire.
Réponse
Trois droites à travers un nuage : 0,762857 < 0,769067 < 0,779650, avec PC1 strictly au milieu. Les deux régressions diffèrent de 2,2 % sur un nuage que le panneau qualifie de monodimensionnel à 99,49 %, et elles diffèrent parce qu'elles répondent à des questions différentes — prédire y à partir de x, ou prédire x à partir de y. PC1 ne répond à aucune des deux. Elle minimise la distance perpendiculaire, de sorte que changer l'étiquetage des axes fait pivoter la figure et laisse la droite exactement là où elle était, et ses résidus constituent la deuxième colonne de scores plutôt qu'un écart vertical. Les trois se confondent en une seule uniquement lorsque det C = 0, c'est-à-dire quand les points sont réellement alignés et qu'il n'y a plus lieu de différer. Entre ces extrêmes, l'ACP est la droite à utiliser lorsque les deux coordonnées comportent des erreurs de mesure, et la mauvaise droite si l'on cherche véritablement une prédiction : la pente de régression est sciemment plus faible, car se rapprocher de l'horizontale est ce qui rend l'erreur quadratique de prédiction la plus petite.
-
Parcours
Des matrices qui transforment l'espace
Références (2)
- Insight block 3 — the perpendicular line of closest fit, thirty years before the name: K. Pearson, "On lines and planes of closest fit to systems of points in space." Philosophical Magazine 2(11), 559–572, 1901.
- Where "principal component" was coined: H. Hotelling, "Analysis of a complex of statistical variables into principal components." Journal of Educational Psychology 24(6), 417–441, 1933.