Lección
La teoría — Prueba F de ANOVA
Un ANOVA de un factor no pregunta si varias medias de grupo difieren —las medias medidas siempre difieren un poco—. Pregunta si difieren más de lo que el puro azar del muestreo produciría. El estadístico F lo hace comparable poniendo la dispersión entre las medias de grupo sobre la dispersión dentro de ellas, y el valor p dice con qué frecuencia el azar por sí solo alcanzaría un cociente así de grande.
Qué significa cada símbolo
MS_between- el cuadrado medio entre grupos: a qué distancia quedan las medias de grupo de la media general, por grado de libertad.
MS_within- el cuadrado medio dentro de los grupos: la dispersión corriente de las observaciones alrededor de la media de su propio grupo. Este es el patrón de medida.
F- su cociente. Alrededor de 1 cuando los grupos se parecen, porque entonces ambos estiman lo mismo.
p- la probabilidad de que grupos realmente idénticos produzcan un F al menos así de grande.
De dónde viene la fórmula
- Supón por un momento que todos los grupos tienen la misma media. Entonces las observaciones son extracciones de una sola población, y hay dos maneras independientes de estimar la varianza de esa población a partir de tus datos.
- La primera ignora del todo la agrupación y solo mide la dispersión dentro de cada grupo: eso es
MS_within. Estima la varianza poblacional difieran o no las medias, y eso es lo que la convierte en un patrón justo. - La segunda usa solo las medias de grupo. Si los grupos son realmente idénticos, las medias igualmente se separan por puro muestreo, y el tamaño de ese temblor es en sí mismo una estimación de la misma varianza: eso es
MS_between. Si las medias no son idénticas, esta segunda estimación queda además inflada por las diferencias reales. - Así que el cociente
F = MS_between / MS_withinenfrenta una estimación que crece cuando las medias difieren con otra que no. Bajo «todas las medias iguales» debería caer cerca de 1 y sigue una distribución conocida: la curva dibujada arriba, fijada por completo por los dos grados de libertad. El valor p es el área de esa curva a la derecha de tu F.
Cómo leer lo que ves
La curva azul es lo que haría F si todas las medias de grupo fueran idénticas, y no depende de nada más que de los dos grados de libertad, no de tus datos. La cola sombreada en rojo es la región de rechazo: los valores tan alejados que ocurrirían por azar menos de un α de las veces, con la línea discontinua en el valor crítico marcando dónde empieza. La línea verde es donde cayó realmente tu F. Todo el contraste se reduce a de qué lado de la línea discontinua queda la verde, y el valor p es el área a su derecha.
- Supone
- Observaciones independientes entre sí, aproximadamente normales dentro de cada grupo y —la que muerde— varianzas aproximadamente iguales entre grupos. Esta página parte de los dos cuadrados medios y no de tus datos, así que no puede comprobar ninguna de las tres por ti. Calculará de buena gana un valor p de aspecto convincente a partir de cualquier par de números positivos.
- Falla cuando
- La igualdad de varianzas es donde se tuerce en silencio.
MS_withinagrupa la dispersión de todos los grupos en un único patrón, y si un grupo es mucho más variable que los demás ese patrón no describe a ninguno; el estadístico deja de seguir la curva de arriba y el valor p mide un área bajo la distribución equivocada. El remedio habitual es el ANOVA de Welch, que no agrupa. Los tamaños de grupo desiguales empeoran el mismo problema, porque entonces la estimación conjunta queda dominada por el grupo más numeroso.
Problema resuelto al detalle
-
Tres grupos, treinta observaciones y un F de 1,33 5 pasos
Tres grupos, treinta observaciones y un valor F de 1,33 que no es significativo. Averigüe de dónde proceden esos grados de libertad y por qué no puede aplicar simplemente tres pruebas t en su lugar.
-
El estadístico F es el cociente de dos estimaciones de la varianza: cuánto difieren las medias de los grupos entre sí, dividido por la dispersión de las observaciones dentro de los grupos. Un valor cercano a 1 indica que los grupos difieren aproximadamente lo mismo que produciría el azar por sí solo.
-
Los grados de libertad revelan el diseño sin necesidad de que se lo indiquen. El primero es el número de grupos menos uno, por lo que hay tres grupos; el segundo es el total de observaciones menos los grupos, por lo que hay treinta observaciones.
-
Al multiplicar cada cuadrado medio por sus grados de libertad se recuperan las sumas de cuadrados: 8 entre grupos y 81 dentro de los grupos, 89 en total.
-
Su cociente es eta cuadrado, la proporción de la variación total que explica la agrupación. Un nueve por ciento.
-
La alternativa es comparar los tres grupos por parejas, lo que supone tres pruebas t. Cada una conlleva una tasa de falsos positivos del 5%, por lo que la probabilidad de al menos una falsa alarma es 1 − 0,95³.
Respuesta
La herramienta muestra F = 1,3333, grados de libertad (2, 27) y η² = 0,0899. De ello se derivan dos conclusiones. En primer lugar, el tamaño del efecto no es cero —la agrupación sí explica el 9% de la variación—, pero con tanta dispersión dentro de los grupos esto no resulta destacable, que es exactamente lo que significa un valor F no significativo y precisamente lo que la gente olvida cuando lo interpreta como "sin diferencias". En segundo lugar, la razón de ser del ANOVA: tres pruebas t por parejas conllevan una probabilidad del 14,3% de obtener al menos un falso positivo, frente al 5% que creía estar asumiendo; y con cinco grupos, esto supone diez pruebas y un 40%. Una sola prueba sobre todos los grupos a la vez es la solución.
-
Ruta de aprendizaje
¿Cuándo es real una diferencia?
Referencias (3)
- The paper that introduced the word “variance” and the decomposition the lesson derives: R. A. Fisher, "The Correlation between Relatives on the Supposition of Mendelian Inheritance." Transactions of the Royal Society of Edinburgh 52(2), 399–433, 1919 (read 1918).
- The repair when the groups do not share a variance, which is the assumption this page cannot check for you: B. L. Welch, "On the Comparison of Several Mean Values: An Alternative Approach." Biometrika 38(3/4), 330–336, 1951.
- Where small-sample testing came from, and why a RATIO of variances was the right thing to look at: G. E. P. Box, "Guinness, Gosset, Fisher, and Small Samples." Statistical Science 2(1), 45–52, 1987.