Explorador de Geometría de Mínimos Cuadrados

Ajusta datos reales con una recta o una curva, y luego examina los residuos que el método de mínimos cuadrados intenta minimizar.

Cargando simulación interactiva...

Lección

La teoría — Explorador de Geometría de Mínimos Cuadrados

“Mínimos cuadrados” hace referencia a lo que se minimiza: la suma de los residuos al cuadrado. Geométricamente, los valores ajustados representan el punto más cercano a tus datos dentro del conjunto de curvas que el modelo puede generar — el más cercano en el sentido habitual de la distancia en línea recta, motivo por el cual el vector residual resultante termina siendo perpendicular a todo lo que el modelo podría haber alcanzado.

Qué significa cada símbolo

residual
una distancia entre un punto de datos y la curva ajustada, medida en vertical. El panel muestra cada una antes de elevarla al cuadrado.
SSE
la suma de los errores al cuadrado — consiste en sumar los cuadrados de todos los residuos. Vale 1.3714 para el ajuste lineal en este caso.
RMSE
la raíz del error cuadrático medio, √(SSE/n) = 0.4781. A diferencia de la SSE, se expresa en las mismas unidades que y, por lo que es la medida que conviene citar.
model
la familia de curvas permitidas. Pasar de recta a cuadrática amplía esa familia de dos parámetros libres a tres.

De dónde viene la fórmula

  1. Cada curva candidata genera una lista de valores ajustados. Considera esa lista como un único punto en un espacio n-dimensional, y tus datos como otro punto en dicho espacio.
  2. La SSE es entonces, literalmente, la distancia al cuadrado entre esos dos puntos. Minimizar la SSE significa encontrar el punto alcanzable más cercano a los datos — una proyección, no una búsqueda.
  3. Y la propiedad fundamental de una proyección es que el error es perpendicular a todo lo alcanzable. Por eso los residuos de un ajuste óptimo siempre suman cero y no muestran correlación remanente con x: cualquier patrón de este tipo sería una dirección en la que el modelo aún podría haberse desplazado.

Cómo leer lo que ves

El número de puntos, luego el modelo ajustado desarrollado, y después la SSE mostrada término a término — −0.7143² + 0.3714² + 0.4571² + ⋯ = 1.3714 — para que puedas ver qué punto está perjudicando el ajuste antes de que los cuadrados oculten los signos. La RMSE aparece al final como resumen interpretable.

Supone
Solo distancias verticales, por lo que x se considera exacta y cada punto tiene el mismo peso. El modelo también debe ser lineal en sus parámetros — propiedad que una cuadrática sigue cumpliendo, a pesar de la curva, porque interviene multiplicado por una constante.
Falla cuando
Una SSE menor no significa un mejor modelo, y puedes comprobarlo aquí con un solo clic. Cambia de recta a cuadrática y la SSE se reducirá de 1.3714 a 0.4071 — siempre iba a disminuir, porque una cuadrática contiene a cualquier recta como el caso particular donde el coeficiente de es cero. Un modelo con más libertad no puede ajustar peor, de modo que la SSE por sí sola nunca podrá decirte si el término extra es real o si solo está ajustando ruido.

La recta de mejor ajuste siempre pasa por el punto medio 🖖

Tengan tus datos la forma que tengan, la recta de mínimos cuadrados pasa con seguridad por (x̄, ȳ), el punto formado por la media de las x y la media de las y. No es una tendencia: sale directamente de la condición de que los residuos sumen cero, así que se cumple para todos los conjuntos de datos sin excepción. Eso te da una comprobación gratuita: marca el punto medio, y cualquier recta candidata que no lo toque no es el ajuste de mínimos cuadrados. También explica la debilidad del método. Como las distancias se elevan al cuadrado, un punto dos veces más lejano tira cuatro veces más fuerte, así que un solo valor atípico puede girar la recta más de lo que una docena de puntos bien portados la sujetan.

Por qué elevamos al cuadrado las distancias 🖖

La herramienta suma los cuadrados de las distancias verticales entre cada punto y la recta, y luego busca la recta que haga ese total lo más pequeño posible. Al elevar al cuadrado, una distancia el doble de grande cuenta cuatro veces más, así que el ajuste se esfuerza por evitar cualquier desviación grande aislada. Arrastra un punto lejos y observa cómo toda la recta se lanza hacia él: ese tirón es el precio directo de elevar al cuadrado.

La regresión no es simétrica 🖖

Como el método de mínimos cuadrados solo reduce las distancias verticales, supone en silencio que y es la variable objetivo y que x es exacta. Intercambia los ejes y vuelve a ajustar: obtendrás una recta distinta, no la imagen especular que esperarías. Ambas rectas pasan por el punto medio de los datos (x̄, ȳ), pero solo coinciden cuando los puntos caen exactamente sobre una recta. Las dos pendientes incluso multiplican dando r², el cuadrado de la correlación.

Práctica

Compruébalo tú mismo

Predice la respuesta primero y luego usa los controles de arriba para comprobarlo. Revela la solución solo cuando te hayas comprometido con una hipótesis: eso es lo que lo convierte en práctica.

  1. Pulsa frenado con recta: seis puntos, un ajuste recto, SCE 84. Ahora pulsa frenado con curva — los mismos seis puntos, ajustados con una cuadrática. Predice la nueva SCE.

    Mostrar la respuesta
    0. No casi cero: cero, con RMSE 0 y una curva ajustada de ŷ = 8 − 0.25x + 0.015x². Esos seis puntos salieron exactamente de esa parábola, y en cuanto la familia de curvas permitidas contiene la verdad no queda nada que elevar al cuadrado. Una SCE que baja no demuestra nada por sí sola — una familia más amplia nunca puede ajustar peor. Una caída hasta el suelo es de otra naturaleza, porque no queda residuo alguno que un modelo posterior pudiera eliminar.
  2. Pulsa retención del curso, que se ajusta con una recta de SCE 1.3714 y una proporción de SCE del punto mayor del 37.2%. Cambia el selector de modelo a Cuadrático. La SCE bajará — predice qué hace esa proporción.

    Mostrar la respuesta
    Sube, hasta el 56.3%, mientras la SCE cae a 0.4071. Una proporción no es una cantidad: la libertad añadida acercó la curva a los puntos que podía alcanzar, así que el único que sigue sin alcanzar ocupa ahora una fracción mayor de un total menor. Un aviso ya que estás aquí — pulsar cualquier preajuste devuelve el selector a Recta, así que estos números solo significan esto mientras siga mostrándose Cuadrático.
  3. Vuelve a frenado con recta. El resultado muestra cinco de los seis residuos antes de su : 5, −1, −4, −4, −1. ¿Cuál es el sexto, y qué te dicen los seis juntos que la SCE 84 no dice?

    Mostrar la respuesta
    +5. Los residuos de un ajuste por mínimos cuadrados siempre suman cero y los cinco mostrados suman −5, así que el que falta queda forzado. El gráfico de residuos dibuja justo esa forma: dos barras altas hacia arriba en los extremos, cuatro hundiéndose en el medio, una U limpia. Sumar cero y no dejar inclinación frente a x es todo lo que garantizan los mínimos cuadrados, y una U simétrica cumple las dos cosas — sus residuos sí suman cero, y no se inclina hacia ningún lado — de modo que una recta no puede absorberla ni advertirla. La SCE dice que el ajuste es holgado; solo el patrón dice que es holgado en una dirección a la vez.

Problema resuelto al detalle

  1. Seis puntos con una suma de errores al cuadrado de 1,3714 5 pasos

    Seis puntos, una recta ajustada y una suma de errores al cuadrado de 1,3714. Calcule qué proporción de ese total procede de un solo punto y demuestre una propiedad de los residuos que se cumple para cualquier ajuste por mínimos cuadrados.

    1. Los coeficientes se obtienen a partir de las dos mismas sumas que en cualquier regresión simple: cómo varían x e y conjuntamente, dividido por cómo varía x por sí sola.

    2. Eso da la recta que indica el panel. Estos datos no tienen nada de especial: se trata de una secuencia casi recta de seis puntos con una ligera dispersión.

    3. Los residuos son lo que el ajuste no ha podido explicar. Al calcular los seis, uno destaca de forma clara: el punto en x = 0 se desvía en −0,7143, aproximadamente el doble del error habitual.

    4. Antes de utilizarlos, observe que su suma es cero; no aproximadamente, sino exactamente. Esto viene impuesto por el término independiente: la segunda ecuación normal es la afirmación de que los residuos tienen media cero, por lo que se cumple para cualquier recta de mínimos cuadrados independientemente de los datos.

    5. Elevar al cuadrado destruye ese equilibrio, y esa es la cuestión. El −0,7143 se convierte en 0,5102, lo que supone el 37,2% del SSE total de 1,3714: un solo punto de seis soporta más de un tercio de la penalización.

    Respuesta

    La herramienta muestra SSE = 1,3714, RMSE = 0,4781 y una proporción del punto mayor del 37,2%. Ambos hechos son importantes y tiran en direcciones opuestas. Que los residuos sumen cero indica que la recta está equilibrada; el 37,2% indica que el ajuste no lo está, porque elevar al cuadrado pondera una desviación del doble con un peso cuatro veces mayor. Por esta razón exacta los mínimos cuadrados son tan sensibles a los valores atípicos, y por la que la propiedad de que los residuos sumen cero no ofrece protección alguna: un único punto anómalo no puede alterar el residuo medio y, sin embargo, puede dominar aquello que la recta intenta minimizar.

Ruta de aprendizaje

Ajustar una recta a datos

Lleva a Regresión lineal la recta de ajuste como una proyección y la razón por la cual sus residuos son perpendiculares al modelo.

Referencias (1)
  • Least squares as an orthogonal projection, which is what makes the residuals perpendicular to the model: G. Strang, Introduction to Linear Algebra, 5th ed., chapter 4 (“Orthogonality”). Wellesley-Cambridge Press, 2016. ISBN 978-0-9802327-7-6.

Problemas de ejemplo

  • retención del curso - Seis puntos, SSE 1,3714 y R² 0,9978. Son los datos del problema resuelto; su recta y = 42,71 + 5,91x pasa por el punto de medias (2,5; 57,5).
  • valor atípico de campaña - Los cinco primeros puntos están exactamente sobre una recta de pendiente 5. El sexto lleva el ajuste hasta 8,54 y concentra por sí solo el 47,5 % de la SSE: un punto de seis acumula casi la mitad del error.
  • frenado con recta - Una recta ajustada a datos parabólicos: SSE 84,0 y R² 0,9618. Parece un buen resultado, pero los residuos cuentan otra historia: forman una curva en vez de dispersarse.
  • frenado con curva - Los mismos seis puntos ajustados con una función cuadrática: y = 8 - 0,25x + 0,015x², con una SSE exactamente igual a 0. Los datos pertenecen a esa parábola hasta la última cifra; la recta dejó una SSE de 84.
  • precios de vivienda - Siete pisos a 2,74 mil por metro cuadrado, R² 0,998 y SSE 88,39. Datos de aspecto real que, aun así, siguen una recta casi perfecta.