Explorador del teorema del límite central

observa cómo las medias muestrales adquieren forma de campana

Cargando simulación interactiva...

Por qué las medias se vuelven normales incluso a partir de fuentes extrañas 🖖

Las medias tienden a la normalidad porque promediar equivale, salvo un cambio de escala, a convolucionar repetidamente. Al convolucionar una distribución consigo misma suficientes veces, sus irregularidades se suavizan. Una vez eliminada la escala, la asimetría y los picos se atenúan, mientras que la dispersión permanece; por eso, sea cual sea la distribución inicial, el resultado se parece cada vez más a una gaussiana. El único requisito esencial es que la varianza sea finita. Una distribución uniforme, una exponencial y otra bimodal con dos picos se acercan a la misma curva de campana, aunque a ritmos distintos. De ahí que n = 30 se convirtiera en la regla práctica informal de la estadística, no en un umbral exacto.

La ley de la raíz cuadrada tras el estrechamiento 🖖

A medida que sigues extrayendo, el histograma de las medias no solo se suaviza: se estrecha. Su dispersión es el error estándar σ/√n, así que la precisión mejora solo con la raíz cuadrada del tamaño muestral: para reducir el ancho a la mitad debes cuadruplicar n. Ese es el corazón práctico del teorema: muestras mayores fijan la media con más exactitud, pero con rendimientos cada vez menores.

La distribución que rompe el teorema 🖖

El teorema supone en silencio una varianza finita, y un forajido famoso la viola: la distribución de Cauchy, el cociente de dos normales estándar. Promedia un millón de extracciones de Cauchy y el resultado sigue exactamente la misma curva de Cauchy que una sola — la campana nunca aparece y más datos no sirven de nada. Sus colas son tan pesadas que un único valor monstruoso puede dominar cualquier promedio, por grande que sea.

Problema resuelto al detalle

  1. La regla de n = 30 para una fuente uniforme en [0, 1] 5 pasos

    ¿Sobre qué trata realmente la regla de n = 30? Este es el estado por defecto: una fuente Uniforme en [0, 1] con un tamaño de muestra n = 30.

    1. La fuente uniforme es plana en [0, 1], de modo que su media se sitúa en el punto medio y su varianza es el segundo momento menos el cuadrado de esta. Todos los números de abajo derivan de este único hecho.

    2. El error estándar se deduce de la varianza y de nada más. No requiere que la fuente sea simétrica, ni acampanada, ni que n sea grande: la fórmula es exacta tanto para n = 1 como para n = 30, y el único hecho que utiliza es que las varianzas de variables independientes se suman.

    3. Así pues, la anchura nunca fue asunto del teorema. Lo es la forma, y la medida estándar de la asimetría es el coeficiente de asimetría. Los terceros momentos centrales se suman para extracciones independientes exactamente igual que las varianzas, y la asimetría está concebida para ser invariable ante un cambio de escala del eje, de modo que combinando ambas cosas, la asimetría de la media decrece como 1/√n.

    4. Las fuentes de la herramienta parten de asimetrías muy distintas. Una fuente uniforme no tiene ninguna que perder, por lo que su media muestral es simétrica para cualquier n, incluido n = 1; una fuente exponencial parte de una asimetría de 2 y sigue sesgada a la derecha para n = 30.

    5. Aplique esa misma relación a la inversa para obtener una asimetría lo suficientemente pequeña como para poder ignorarla.

    Respuesta

    La tabla muestra una media de la distribución de origen de 0,5 y un error estándar de 0,052705; para reproducirlos basta con la varianza 1/12. Los tres últimos pasos aclaran que este valor no procede del teorema: el error estándar es exacto para cualquier n y cualquier distribución de varianza finita. Lo que aporta n es la forma.

    La distribución uniforme ya es simétrica, así que aumentar n a 30 no reduce su asimetría. En la configuración predeterminada de esta página, la regla práctica no interviene. Una distribución exponencial con n = 30 aún tiene una asimetría de 0,365; para bajarla de 0,1 hace falta n = 400.

    La distribución bimodal, que de las tres es la que menos se parece a una normal, converge casi tan deprisa como la uniforme. También es simétrica, por lo que su asimetría vale 0 para todo n. Su exceso de curtosis, −1,28, disminuye como 1/n hasta −0,043 cuando n = 30, frente al −0,040 de la uniforme. Ninguno de esos tres valores aparece en una fila de la tabla; la convergencia solo puede apreciarse en el histograma.

Ruta de aprendizaje

De recuentos a curvas

Lleva a Puntuación Z la razón por la que esa curva sigue apareciendo cuando nada es binomial.

Referencias (1)
  • Insight block 3 — why averaging Cauchy draws returns the same Cauchy curve: W. Feller, An Introduction to Probability Theory and Its Applications, Volume 2, 2nd ed., ch. VI and XVII. Wiley, 1971. ISBN 978-0-471-25709-7 — stable laws, and the finite-variance condition the central limit theorem actually needs.

Problemas de ejemplo

  • uniforme, n=5 - Una distribución uniforme en [0, 1] tiene una desviación estándar de 0,2887, así que el promedio de cinco extracciones tiene un error estándar de 0,129. El histograma ya es simétrico, pues una distribución uniforme carece de asimetría. Con n = 5 solo falta que se estreche.
  • uniforme, n=30 - Multiplicar por seis el tamaño de la muestra mejora la precisión en un factor √6: el error estándar baja de 0,129 a 0,0527. La forma nunca fue el problema en una distribución uniforme, de modo que en esta configuración la regla práctica de n = 30 no aporta nada.
  • exponencial, n=30 - Esta distribución presenta una marcada asimetría a la derecha, con un coeficiente de asimetría de 2. Al promediar 30 extracciones, se divide por √30 y queda en 0,365, una inclinación todavía visible en el histograma. Para bajarlo de 0,1 haría falta una muestra de 400.
  • bimodal, n=30 - Tiene dos picos y converge casi tan deprisa como la distribución uniforme. Al ser simétrica, su asimetría vale 0 para todo n. Debe reducir su exceso de curtosis, que parte de −1,28 y disminuye como 1/n, en lugar de 1/√n, hasta llegar a −0,043 con 30 extracciones.