Problemas resueltos al detalle
-
Seis puntos con el 99,49% de la varianza en PC1 y el 0,51% en PC2 8 pasos
Seis puntos: (2, 1), (3, 2), (4, 2,2), (5, 3,2), (6, 3,9), (7, 5). El panel indica un 99,49% de la varianza en PC1 y un 0,51% en PC2, lo que sugiere una nube que es esencialmente una recta. Calcule a qué distancia de esa recta se encuentran realmente los puntos.
-
Centre primero, ya que todo lo que sigue atañe a la dispersión y nada a la posición. Los valores de x van de 2 a 7 en pasos unitarios, por lo que su media se sitúa en el centro del intervalo y la columna centrada de x es simétrica: ±0,5, ±1,5, ±2,5. Solo y requiere cálculos.
-
La covarianza divide la suma de productos entre n − 1 = 5, no entre 6. Ya se ha empleado un grado de libertad al estimar la media que se acaba de restar y, con solo seis puntos, esa corrección supone un 20%.
-
Dos números bastan para obtener ambos autovalores, y ninguno de ellos requiere una dirección. La traza es la varianza total; el determinante mide cuánto se aleja la matriz de ser singular. Frente a una traza de 5,581667, un determinante de 0,156933 corresponde a una matriz muy próxima al rango 1.
-
Resuelva la ecuación cuadrática característica. λ1 resulta ser unas 200 veces λ2 — la forma de esta nube condensada en una sola comparación.
-
Las filas de varianza explicada representan esa razón y nada más. Así pues, el 99,49% es una afirmación sobre λ1 y λ2, e hereda lo que estos son: varianzas, que llevan las unidades de los datos al cuadrado. Conserve esa idea.
-
La dirección es el autovector y, para una matriz de covarianza de 2×2 con un elemento fuera de la diagonal distinto de cero, se puede escribir directamente sin resolver nada: (λ1 − Syy, Sxy) ya apunta a lo largo de PC1. Escálelo a longitud unitaria y obtendrá el vector impreso.
-
Gire ese vector un cuarto de vuelta para obtener v2 y proyecte sobre él el primer punto centrado. El resultado, 0,031179, es el segundo número de la tabla de puntuaciones. De modo que toda esa columna —que el panel imprime sin explicar nunca qué es— es la distancia con signo de cada punto a la recta PC1, y el peor de los seis es −0,236855.
-
Llegamos ahora a la pregunta que ocultaban los porcentajes. λ2 es una varianza, por lo que es una distancia al cuadrado, y el alejamiento típico es su raíz cuadrada. Compare eso con la raíz cuadrada de λ1, que es la dispersión a lo largo de la recta.
Respuesta
Los puntos se sitúan a aproximadamente un 7,13% de la longitud de la nube con respecto a la recta PC1, no a un 0,51%. Ambas cifras describen los mismos seis puntos; una es una razón de cuadrados y la otra una razón de longitudes, y la raíz cuadrada entre ellas supone aquí un factor de 14. Esa diferencia es la trampa de toda regla del tipo "conservar el 99% de la varianza": para mantener el alejamiento perpendicular por debajo del 1% de la dispersión se requiere que PC2 esté por debajo del 0,01% de la varianza, cien veces más estricto de lo que sugiere la regla. En unidades de los datos, el alejamiento es √λ2 = 0,168104, y no está oculto: aparece dibujado en el gráfico como el segmento gris que va desde cada punto verde a su proyección azul, y es evidente que tales segmentos no tienen longitud cero.
-
-
PC1 de pendiente 0,769 y un ajuste por mínimos cuadrados de 0,763 6 pasos
PC1 figura impreso como (0,792687, 0,609629), una dirección con pendiente 0,769. El ajuste de y a x por mínimos cuadrados, a partir de las mismas entradas de covarianza, da 2,67/3,5 = 0,763. Dos rectas a través de una misma nube de seis puntos. Demuestre cuál es la más empinada —y que siempre es esa misma.
-
Los mínimos cuadrados sobre y minimizan las distancias verticales, y el valor que minimiza es Sxy/Sxx. Observe lo que hay en el denominador: la dispersión de x por sí sola. El ajuste toma x como un dato y solo pregunta qué hace y en respuesta.
-
La pendiente de PC1 se lee directamente del vector unitario impreso, dado que una dirección (a, b) tiene por pendiente b/a. Se sitúa unas 6 milésimas por encima de la pendiente de regresión: pequeña, pero no nula.
-
Para comparar ambas adecuadamente, escriba la pendiente de PC1 tal como la define el autovector en lugar de como una razón de decimales. El numerador es el mismo Sxy en ambos casos, por lo que toda la diferencia reside en el denominador: Sxx para la regresión, λ1 − Syy para PC1.
-
Desarrolle λ1. Saber si el PCA tiene el denominador menor se ha convertido ahora en una cuestión sobre una sola raíz cuadrada.
-
Y esa raíz cuadrada es menor que la traza exactamente cuando el determinante es positivo, lo cual se cumple para cualquier nube que no sea una línea recta perfecta. Por lo tanto, el denominador de PC1 es siempre el menor, de modo que PC1 es siempre la más empinada de las dos. No se ha utilizado ninguna propiedad particular de estos seis puntos.
-
Invierta los papeles y realice la regresión de x sobre y en su lugar. Esa es una tercera recta, y al reescribir su pendiente para la misma representación de y frente a x, el valor resulta ser 0,779650. PC1 no cambia al intercambiar las variables —la matriz de covarianza es simétrica en x e y—, por lo que el argumento del paso anterior se aplica ahora en sentido inverso, siendo PC1 la menos empinada de este par.
Respuesta
Tres rectas a través de una misma nube: 0,762857 < 0,769067 < 0,779650, con PC1 estrictamente en el medio. Las dos regresiones discrepan en un 2,2% sobre una nube que el panel califica de unidimensional en un 99,49%, y discrepan porque responden a preguntas distintas: predecir y a partir de x, o predecir x a partir de y. PC1 no responde a ninguna de las dos. Minimiza la distancia perpendicular, de modo que renombrar los ejes rota la imagen y deja la recta exactamente donde estaba, siendo sus residuos la segunda columna de puntuaciones en lugar de una distancia vertical. Las tres se reducen a una sola únicamente cuando det C = 0, es decir, cuando los puntos son realmente colineales y ya no hay nada sobre lo que discrepar. Entre esos extremos, el PCA es la recta adecuada cuando ambas coordenadas contienen error de medida, y la recta incorrecta cuando lo que realmente se desea es realizar una predicción: la pendiente de regresión es deliberadamente menos empinada, porque atenuarla hacia la horizontal es lo que minimiza el error cuadrático de predicción.
-
Ruta de aprendizaje
Matrices que mueven cosas
Referencias (2)
- Insight block 3 — the perpendicular line of closest fit, thirty years before the name: K. Pearson, "On lines and planes of closest fit to systems of points in space." Philosophical Magazine 2(11), 559–572, 1901.
- Where "principal component" was coined: H. Hotelling, "Analysis of a complex of statistical variables into principal components." Journal of Educational Psychology 24(6), 417–441, 1933.