Regresión Lineal

Introduce puntos de datos y observa la recta de mejor ajuste, los residuos y las estadísticas de correlación.

Cargando simulación interactiva...

Lección

La teoría — Regresión Lineal

La recta de mínimos cuadrados es la única recta que hace que la suma de las distancias verticales al cuadrado entre los puntos y la recta sea lo más pequeña posible. Al cuadrado por dos razones: para que las diferencias por encima y por debajo no se cancelen entre sí, y para que una distancia grande cuente más que varias pequeñas.

Qué significa cada símbolo

b
la pendiente — cuánto cambia y por cada unidad de x.
a
la ordenada en el origen — el valor ajustado de y en x = 0, esté o no x = 0 cerca de los datos.
ŷ
un valor ajustado: lo que predice la recta para un x dado. El acento circunflejo lo distingue de un y observado.
la proporción de la variación en y de la que da cuenta la recta, entre 0 y 1.
r
la r de Pearson, la correlación — la misma información que pero con signo, por lo que transmite también la dirección.

De dónde viene la fórmula

  1. Escribe la cantidad que se va a minimizar: S = Σ(y − a − b·x)², sumada para cada punto.
  2. S es una función suave de a y b, por lo que en su mínimo ambas derivadas parciales son cero. Al igualarlas a cero se obtienen dos ecuaciones lineales en a y b — las ecuaciones normales.
  3. Al resolverlas para la pendiente se obtiene b = (n·Σxy − Σx·Σy) / (n·Σx² − (Σx)²) — la fórmula mostrada arriba con las cinco sumas sustituidas: (5·69.7 − 15·19.8) / (5·55 − 15²) = 51.5 / 50 = 1.03.
Supone
Que una línea recta es la forma adecuada de partida, y que todo el error reside en y: son las distancias verticales las que se minimizan, por lo que x se trata como conocido con exactitud. Cada punto tiene además el mismo peso, por muy alejado que esté de los demás.
Falla cuando
La recta no tiene forma de saber dónde terminan tus datos. Los puntos por defecto van de x = 1 a x = 5; si pides una predicción en x = 6, devuelve ŷ(6) = 7.05 sin protestar por estar extrapolando más allá de cualquier observación a partir de la cual se construyó. Un elevado tampoco ofrece protección: mide qué tan bien se ajusta una recta, nunca si una recta era lo adecuado para ajustar.

por qué un solo punto puede secuestrar toda la recta 🖖

Los mínimos cuadrados minimizan la suma de los cuadrados de los residuos, así que un punto alejado de la tendencia se penaliza de forma cuadrática — atrae la recta hacia sí mucho más que un punto normal. La distancia de Cook mide exactamente eso: cuánto se desplazaría la recta ajustada si se eliminara ese punto. Un R² alto también puede ocultarlo — un único punto influyente puede inflar la correlación aunque el resto de la nube esté casi sin correlacionar. Arrastra el punto marcado hacia fuera y observa cómo la pendiente lo persigue.

qué hace en realidad la recta de mejor ajuste 🖖

La herramienta traza la única recta que queda más cerca de todos tus puntos a la vez. "Más cerca" significa la menor suma de las distancias verticales al cuadrado entre cada punto y la recta: esas distancias son los residuos, dibujados como pequeños segmentos. Luego R² indica cuánta de la variación de y explica la recta: R² = 0.8 significa que la recta explica el 80% de la dispersión y deja un 20% sin explicar.

cambia los ejes y la recta se mueve 🖖

Ajustar y en función de x minimiza las distancias verticales, pero ajustar x en función de y minimiza las horizontales: dos rectas distintas sobre la misma nube, aunque ambas pasen por el punto medio (x̄, ȳ). Multiplica sus dos pendientes y obtienes exactamente r². Así, la conocida r es la media geométrica de las dos pendientes de regresión, y las rectas coinciden solo cuando el ajuste es perfecto (r = 1).

Práctica

Compruébalo tú mismo

Predice la respuesta primero y luego usa los controles de arriba para comprobarlo. Revela la solución solo cuando te hayas comprometido con una hipótesis: eso es lo que lo convierte en práctica.

  1. Pulsa Spearman ρ=1: los puntos 1, 2.5, 5, 9, 16, 28 suben en cada paso, y el nombre del preajuste ya delata que ρ = 1. Predice la r de Pearson para esos mismos puntos.

    Mostrar la respuesta
    0.9382, con R² = 0.8803 — alta, y nada cerca del 1 que informa ρ. El desarrollo de ρ muestra por qué vale exactamente 1: los rangos de x y de y coinciden posición por posición, así que Σd² = 0 y la fórmula se reduce a 1 − 0. Pearson no mide el orden, mide la rectitud, y estos puntos se curvan. Perfectamente ordenado y perfectamente lineal son propiedades distintas, y este conjunto de datos las separa.
  2. El mismo preajuste. El aviso de debajo marca el punto (6, 28) como de alta influencia, D de Cook ≈ 1.7931. ¿Es un error ese punto?

    Mostrar la respuesta
    No — es tan sólido como cualquier otro punto de aquí. La D de Cook mide cuánto se movería la recta ajustada si se retirase un punto, no si el punto es correcto, y este mueve mucho la recta por una razón que nada tiene que ver con la calidad del dato: la tendencia se curva, el ajuste es recto, y el punto más alejado a lo largo de esa curva es con el que más batalla una recta. La influencia describe una posición, nunca un error.
  3. Pulsa Sin correlación — una nube sin ninguna tendencia visible. ¿Se niega la página a ajustar una recta?

    Mostrar la respuesta
    No se niega nunca. Sale ŷ = 4 + 0.1429·x, impreso con exactamente la misma seguridad que cualquier otro ajuste, y solo R² = 0.0137 y la nota que dice correlación débil sugieren otra cosa. Los mínimos cuadrados siempre devuelven la mejor recta disponible; el método no tiene ninguna noción de “aquí no hay relación”, solo de “el menor total de distancias al cuadrado”. Si una recta tenía sentido o no es cosa de tu criterio, y nada en el resultado lo va a decidir por ti.

Problema resuelto al detalle

  1. Obtención de la pendiente y la ordenada en el origen para y = 0,87 + 1,03x 5 pasos

    Cinco puntos y una recta de mejor ajuste de y = 0,87 + 1,03x con R² = 0,996. Deducir la pendiente y la ordenada en el origen desde cero y, a continuación, demostrar una propiedad de toda recta de mínimos cuadrados que el panel nunca menciona.

    1. Las medias van primero, porque ambos coeficientes se construyen a partir de las desviaciones respecto a ellas.

    2. El método de los mínimos cuadrados minimiza la suma de los residuos verticales al cuadrado. Al derivar esa suma e igualarla a cero se obtienen las ecuaciones normales, cuya solución es un cociente de dos sumas: cómo varían conjuntamente x e y, sobre cómo varía x por sí sola.

    3. La pendiente es 1,03. La ordenada en el origen se obtiene a continuación sin necesidad de ninguna minimización adicional, ya que la segunda ecuación normal es simplemente el requisito de que los residuos sumen cero.

    4. La correlación utiliza las mismas dos sumas más la variación de y. Al elevarla al cuadrado se obtiene R² = 0,996, la proporción de la variación de y que la recta explica.

    5. Ahora la propiedad. La ordenada en el origen se definió como ȳ − b·x̄, por lo que al sustituir de nuevo x̄ en la recta se obtiene exactamente ȳ.

    Respuesta

    La herramienta muestra una pendiente de 1,03, una ordenada en el origen de 0,87, R² = 0,996 y r = 0,998. La clave estructural aparece al final: toda recta de mínimos cuadrados pasa por el punto medio de los datos, sean cuales sean los puntos. No es una propiedad de este conjunto de datos, sino una consecuencia de la fórmula de la ordenada en el origen. Por eso, al arrastrar un punto, la recta de regresión gira alrededor del centroide en vez de desplazarse entera. También es la comprobación más rápida para saber si el ajuste es correcto: sustituye x por su media; si no obtienes la media de y, el ajuste está mal. Prueba el conjunto predefinido con un valor atípico. La herramienta cargará otros datos: cinco puntos situados exactamente sobre y = 2x y un sexto en (6, 30). Este último cambia la pendiente de 2 a 4,57 y la ordenada en el origen a −6, aunque la recta sigue pasando exactamente por el nuevo punto medio, (3,5, 10).

Ruta de aprendizaje

Ajustar una recta a datos

Referencias (1)

Problemas de ejemplo