Dispersión y desviación

The centre is one number; spread says how far the data live from it.

Cargando simulación interactiva...

Un ajuste cuesta un grado de libertad 🖖

La media muestral es el único número que reduce al mínimo absoluto la suma de las desviaciones al cuadrado. Por tanto, si mides una muestra respecto a su propia media, el total siempre será menor que si la mides respecto a la media poblacional que no puedes ver. Dividir entre n hereda ese déficit. En el experimento anterior, las muestras de cinco dejan al divisor n aproximadamente una quinta parte por debajo, y el resultado se queda corto en cada extracción, no solo en promedio. Dividir entre n − 1 es el factor que compensa la diferencia.

La desviación estándar no es distancia media 🖖

Elevar las desviaciones al cuadrado, promediarlas y luego extraer la raíz no es lo mismo que promediar las distancias, porque al elevar al cuadrado haces que un valor alejado el doble de la media cuente cuatro veces más. La diferencia siempre va en un solo sentido. La desviación estándar nunca es menor que la desviación media absoluta en ninguna lista de números, y ambas coinciden únicamente cuando todos los valores se sitúan a la misma distancia de la media. Las puntuaciones de la clase indican 2,55 y 2,00; el ajuste con un valor atípico, que carga el divisor muestral, indica 5,15 y 3,13.

El IQR ignora deliberadamente los extremos 🖖

El rango intercuartílico descarta la cuarta parte inferior y la cuarta parte superior de los datos antes de medir nada. Esto es exactamente lo que lo vuelve inmune a un solo valor extremo. Pero también lo hace sordo. Tanto el grupo compacto como el ajuste con un valor atípico de esta página reportan un RIC de 2,00, mientras que sus desviaciones estándar son 1,22 y 5,15. Un RIC por sí solo no te dice nada sobre hasta dónde llegan los datos.

Problema resuelto al detalle

  1. El valor atípico evidente que una regla de tres sigmas no puede señalar 9 pasos

    El ajuste one outlier contiene siete valores entre 4 y 7 y uno en 20. Calcula la puntuación z de ese último a partir de la desviación típica muestral y decide después si una regla que señala todo lo que pase de tres desviaciones típicas habría podido cazarlo alguna vez.

    1. Suma los ocho valores y repártelos: 60 entre 8 son 7,50. Siete de los ocho quedan por debajo, así que el único valor alto ya está moviendo el centro antes de tocar la dispersión.

    2. Resta 7,50 a cada uno. Los siete valores apiñados quedan a distancias de entre 0,5 y 3,5; el octavo queda a 12,5. El panel imprime esa columna, y suma cero, como hace toda columna de desviaciones.

    3. Al elevar al cuadrado, el total se desequilibra. Los siete juntos aportan 29,75, y el valor en 20 aporta 156,25 él solo, más de cinco veces todo el resto de la muestra. Ahí está el cuadrado haciendo el trabajo para el que está.

    4. Este ajuste carga el modo muestral, de modo que el divisor es 7 y no 8. El panel imprime la fracción además del resultado: 186,00 entre 7 da una varianza de 26,57 y una desviación típica de 5,15. Lleva esa división un decimal más allá y s es 5,1547, que es lo que necesita el paso siguiente.

    5. Una puntuación z cuenta desviaciones típicas desde la media, así que aquí es 12,5 entre 5,1547, es decir, 2,4249. El valor más llamativo del conjunto no llega a tres, y no anda cerca.

    6. Pregúntate ahora si eso es un hecho sobre esta lista o sobre ocho números en general. Lo decide una sola cosa: las desviaciones suman cero, así que sean cuales sean las otras siete, suman exactamente el opuesto de la octava.

    7. Unos números con suma fija alcanzan la menor suma de cuadrados posible cuando son todos iguales. Por tanto, las siete desviaciones restantes no pueden ser todas pequeñas: lo más económico que pueden hacer es repartirse la carga por igual, y eso pone un suelo al total de cuadrados.

    8. Un suelo al total de cuadrados es un suelo a s, y un suelo a s es un techo para z. Ningún valor de una lista de n puede estar a más de (n − 1)/√n desviaciones típicas muestrales de la media. Con n = 8 ese techo es 2,4749. Sube el 20 hasta 100 y el panel da una desviación de 82,50 frente a una desviación típica de 33,35, con lo que z es 2,474. Súbelo a un millón y z llega a 2,4749 con cuatro decimales, y ahí se detiene.

    9. El techo depende de n y de nada más, y supera el 3 por primera vez con once valores: diez llegan a 2,846, once llegan a 3,015. Aquí la lista admite doce, así que el caso extremo está a tu alcance. Escribe diez ceros y un 1000, todavía en modo muestral. El panel da una media de 90,91 y una desviación típica de 301,51, y la mayor desviación, 909,09, dividida entre 301,51 da 3,015, que es el techo mismo.

    Respuesta

    z = 2,42, y ninguna regla de tres sigmas habría podido señalarlo, porque ocho números no pueden producir una z de 3 por muy extremo que sea uno de ellos.

    Más que equivocarse, aquí la regla resulta inservible, y eso es lo que conviene llevarse: un umbral escrito en desviaciones típicas habla del tamaño de la muestra tanto como del valor, porque el valor que se examina está dentro de la desviación típica con la que se le mide. Tres desviaciones típicas necesitan al menos 11 observaciones para ser siquiera alcanzables, cuatro necesitan 18, y por debajo de esos tamaños una muestra contaminada le parece a la prueba exactamente igual que una limpia. Algo que sí funciona con ocho números ya está en esta página. La valla de Tukey pone la frontera en Q3 + 1,5 × IQR; el panel da Q3 = 7,00 e IQR = 2,00, de modo que la valla queda en 10 y el valor 20 se sale con holgura. Los cuartiles son posiciones dentro de la lista ordenada y no promedios de ella, y por eso el punto que se está juzgando no puede mover la regla.

Ruta de aprendizaje

Un número para muchos: estadísticas de resumen

Problemas de ejemplo

  • classroom scores - Ocho calificaciones entre 4 y 13. Lee la columna central hacia abajo y verás que las desviaciones se anulan hasta dar cero. Por eso la tercera columna las eleva primero al cuadrado. Esos cuadrados suman 52,00. Al dividir entre n = 8, obtenemos una varianza de 6,50, una desviación estándar de 2,55 y una desviación media absoluta de 2,00.
  • tight cluster - Ocho lecturas entre 48,00 y 52,00. A la dispersión no le importa la magnitud de los números, solo la distancia que los separa. Las desviaciones al cuadrado suman 12,00 y la desviación estándar es 1,22, frente a una desviación media absoluta de 1,00. Carga luego el conjunto del valor atípico y observa cómo se separa ese par.
  • one outlier - Siete valores se aglomeran entre 4 y 7, y uno solitario se sitúa en 20. Ese único punto aporta 156,25 del total de 186,00 en la columna de los cuadrados. Así, la desviación estándar alcanza 5,15 mientras que la desviación media absoluta se queda en 3,13. El rango intercuartílico ni se entera: Q1 y Q3 son 5,00 y 7,00, de manera que el RIC se mantiene en 2,00 por muy lejos que llegue ese último valor. Este es el único ajuste predeterminado que carga el divisor muestral.