Visualizador de PCA 2D/3D

Centra los datos, calcula las direcciones principales y analiza cuánta varianza se captura.

Cargando simulación interactiva...

Cambia las unidades y el PCA da otra respuesta 🖖

El ACP se basa en la matriz de covarianzas, y la covarianza conserva las unidades. Si registras la altura de una persona en metros y su peso en kilogramos, obtienes unos componentes determinados. Pasa la altura a milímetros: los valores de esa variable se multiplican por mil, su varianza por un millón y el primer componente principal gira hasta apuntar casi por completo en esa dirección. Los datos no han cambiado; solo ha cambiado la regla con que los mides. Por eso, en los análisis reales se estandariza primero cada variable para que tenga media cero y varianza unitaria. Esto equivale a aplicar el ACP a la matriz de correlaciones en lugar de a la matriz de covarianzas. A diferencia de la regresión, el ACP no puede distinguir entre un número grande y uno importante.

La dirección en la que se inclinan tus datos 🖖

El análisis de componentes principales busca la única recta a lo largo de la cual más se extiende tu nube de puntos y mide la posición de cada punto sobre ella. El porcentaje de varianza explicada indica cuánta de la dispersión conserva esa recta. Aquí, cuando PC1 supera cerca del 85 %, la herramienta avisa de que un resumen plano en 1D casi no pierde nada. Cambia entre los conjuntos de ejemplo y observa cómo una nube muy correlacionada cede casi toda su varianza a PC1.

No es lo mismo que una recta de regresión 🖖

Es tentador interpretar el CP1 como la recta de mejor ajuste habitual, pero cada método optimiza una cantidad distinta. La regresión lineal minimiza las distancias verticales a la recta, medidas a lo largo del eje y; el ACP minimiza las distancias perpendiculares. Para un mismo conjunto de puntos, las dos rectas pueden ser realmente distintas. Karl Pearson publicó precisamente esta recta de ajuste por distancias perpendiculares en 1901, tres décadas antes de que se acuñara el término componente principal.

Problemas resueltos al detalle

  1. Seis puntos con el 99,49% de la varianza en PC1 y el 0,51% en PC2 8 pasos

    Seis puntos: (2, 1), (3, 2), (4, 2,2), (5, 3,2), (6, 3,9), (7, 5). El panel indica un 99,49% de la varianza en PC1 y un 0,51% en PC2, lo que sugiere una nube que es esencialmente una recta. Calcule a qué distancia de esa recta se encuentran realmente los puntos.

    1. Centre primero, ya que todo lo que sigue atañe a la dispersión y nada a la posición. Los valores de x van de 2 a 7 en pasos unitarios, por lo que su media se sitúa en el centro del intervalo y la columna centrada de x es simétrica: ±0,5, ±1,5, ±2,5. Solo y requiere cálculos.

    2. La covarianza divide la suma de productos entre n − 1 = 5, no entre 6. Ya se ha empleado un grado de libertad al estimar la media que se acaba de restar y, con solo seis puntos, esa corrección supone un 20%.

    3. Dos números bastan para obtener ambos autovalores, y ninguno de ellos requiere una dirección. La traza es la varianza total; el determinante mide cuánto se aleja la matriz de ser singular. Frente a una traza de 5,581667, un determinante de 0,156933 corresponde a una matriz muy próxima al rango 1.

    4. Resuelva la ecuación cuadrática característica. λ1 resulta ser unas 200 veces λ2 — la forma de esta nube condensada en una sola comparación.

    5. Las filas de varianza explicada representan esa razón y nada más. Así pues, el 99,49% es una afirmación sobre λ1 y λ2, e hereda lo que estos son: varianzas, que llevan las unidades de los datos al cuadrado. Conserve esa idea.

    6. La dirección es el autovector y, para una matriz de covarianza de 2×2 con un elemento fuera de la diagonal distinto de cero, se puede escribir directamente sin resolver nada: (λ1 − Syy, Sxy) ya apunta a lo largo de PC1. Escálelo a longitud unitaria y obtendrá el vector impreso.

    7. Gire ese vector un cuarto de vuelta para obtener v2 y proyecte sobre él el primer punto centrado. El resultado, 0,031179, es el segundo número de la tabla de puntuaciones. De modo que toda esa columna —que el panel imprime sin explicar nunca qué es— es la distancia con signo de cada punto a la recta PC1, y el peor de los seis es −0,236855.

    8. Llegamos ahora a la pregunta que ocultaban los porcentajes. λ2 es una varianza, por lo que es una distancia al cuadrado, y el alejamiento típico es su raíz cuadrada. Compare eso con la raíz cuadrada de λ1, que es la dispersión a lo largo de la recta.

    Respuesta

    Los puntos se sitúan a aproximadamente un 7,13% de la longitud de la nube con respecto a la recta PC1, no a un 0,51%. Ambas cifras describen los mismos seis puntos; una es una razón de cuadrados y la otra una razón de longitudes, y la raíz cuadrada entre ellas supone aquí un factor de 14. Esa diferencia es la trampa de toda regla del tipo "conservar el 99% de la varianza": para mantener el alejamiento perpendicular por debajo del 1% de la dispersión se requiere que PC2 esté por debajo del 0,01% de la varianza, cien veces más estricto de lo que sugiere la regla. En unidades de los datos, el alejamiento es √λ2 = 0,168104, y no está oculto: aparece dibujado en el gráfico como el segmento gris que va desde cada punto verde a su proyección azul, y es evidente que tales segmentos no tienen longitud cero.

  2. PC1 de pendiente 0,769 y un ajuste por mínimos cuadrados de 0,763 6 pasos

    PC1 figura impreso como (0,792687, 0,609629), una dirección con pendiente 0,769. El ajuste de y a x por mínimos cuadrados, a partir de las mismas entradas de covarianza, da 2,67/3,5 = 0,763. Dos rectas a través de una misma nube de seis puntos. Demuestre cuál es la más empinada —y que siempre es esa misma.

    1. Los mínimos cuadrados sobre y minimizan las distancias verticales, y el valor que minimiza es Sxy/Sxx. Observe lo que hay en el denominador: la dispersión de x por sí sola. El ajuste toma x como un dato y solo pregunta qué hace y en respuesta.

    2. La pendiente de PC1 se lee directamente del vector unitario impreso, dado que una dirección (a, b) tiene por pendiente b/a. Se sitúa unas 6 milésimas por encima de la pendiente de regresión: pequeña, pero no nula.

    3. Para comparar ambas adecuadamente, escriba la pendiente de PC1 tal como la define el autovector en lugar de como una razón de decimales. El numerador es el mismo Sxy en ambos casos, por lo que toda la diferencia reside en el denominador: Sxx para la regresión, λ1 − Syy para PC1.

    4. Desarrolle λ1. Saber si el PCA tiene el denominador menor se ha convertido ahora en una cuestión sobre una sola raíz cuadrada.

    5. Y esa raíz cuadrada es menor que la traza exactamente cuando el determinante es positivo, lo cual se cumple para cualquier nube que no sea una línea recta perfecta. Por lo tanto, el denominador de PC1 es siempre el menor, de modo que PC1 es siempre la más empinada de las dos. No se ha utilizado ninguna propiedad particular de estos seis puntos.

    6. Invierta los papeles y realice la regresión de x sobre y en su lugar. Esa es una tercera recta, y al reescribir su pendiente para la misma representación de y frente a x, el valor resulta ser 0,779650. PC1 no cambia al intercambiar las variables —la matriz de covarianza es simétrica en x e y—, por lo que el argumento del paso anterior se aplica ahora en sentido inverso, siendo PC1 la menos empinada de este par.

    Respuesta

    Tres rectas a través de una misma nube: 0,762857 < 0,769067 < 0,779650, con PC1 estrictamente en el medio. Las dos regresiones discrepan en un 2,2% sobre una nube que el panel califica de unidimensional en un 99,49%, y discrepan porque responden a preguntas distintas: predecir y a partir de x, o predecir x a partir de y. PC1 no responde a ninguna de las dos. Minimiza la distancia perpendicular, de modo que renombrar los ejes rota la imagen y deja la recta exactamente donde estaba, siendo sus residuos la segunda columna de puntuaciones en lugar de una distancia vertical. Las tres se reducen a una sola únicamente cuando det C = 0, es decir, cuando los puntos son realmente colineales y ya no hay nada sobre lo que discrepar. Entre esos extremos, el PCA es la recta adecuada cuando ambas coordenadas contienen error de medida, y la recta incorrecta cuando lo que realmente se desea es realizar una predicción: la pendiente de regresión es deliberadamente menos empinada, porque atenuarla hacia la horizontal es lo que minimiza el error cuadrático de predicción.

Ruta de aprendizaje

Matrices que mueven cosas

Referencias (2)

Problemas de ejemplo

  • nube 2D correlacionada - Una nube compacta con correlación positiva, r = 0,989, en la que el CP1 conserva el 99,49 % de la varianza. Al resumirla en una dimensión, se pierde medio punto porcentual.
  • datos 2D agrupados - Hay dos grupos compactos, no una recta, y aun así el CP1 indica un 99,51 %, igual que en la nube correlacionada. Una proporción alta de varianza explicada no implica que los datos sigan una relación lineal.
  • dispersión equilibrada - Es el único caso predefinido por debajo del 85 %, con un 62,83 %, y también el único en el que el CP1 y la recta de regresión discrepan a simple vista: pendiente -1,00 frente a -0,26.
  • influencia de un valor atípico - Cuatro puntos forman un grupo y otro está en (5,2; 4,8). Ese único punto produce el valor más alto de CP1 en la herramienta, un 99,67 %: la estructura detectada es el valor atípico.
  • pendiente negativa - Una recta negativa casi perfecta: r = -0,9986 y un 99,93 % en el CP1, el ajuste más estrecho de todos. El ACP capta la dirección; el signo de la pendiente no influye.