Esta es una traducción automática y el texto original está en inglés. Leer el original

Haz veinte pruebas sobre nada en absoluto y una de ellas resultará significativa

A researcher sits alone at a desk late at night in a university office, holding a single printed chart up to the lamp with a doubtful expression, dozens more pinned across the wall behind her.

Una prueba con datos reales da p = 0,0002982. Veinte pruebas con ruido puro te dan un titular.

20 INDEPENDENT TESTS · α = 0.05 · NO REAL EFFECTone “significant” result, from nothing at all0.95²⁰ = 0.358P(at least one) = 64.2%fix: test each at α/20 = 0.0025if you know how many you ran
Veinte pruebas honestas con α = 0,05, cada una con un 95% de probabilidades de comportarse correctamente. La probabilidad de que las veinte se comporten correctamente es 0,95²⁰ = 35,8%, por lo que el resultado más probable es una falsa alarma.

Abre la t-test tool con sus valores predeterminados: una muestra de 30 con una media de 78 frente a un valor hipotético de 72, desviación estándar 8. Indica t = 4,1079 con 29 grados de libertad y p = 0,0002982. Esto representa tres probabilidades entre diez mil de observar una diferencia así de grande si no existiera diferencia real alguna. Rechaza la hipótesis nula y quédate bastante tranquilo.

Ahora establece α = 0,05 y piensa en lo que promete realmente ese umbral.

La promesa es por prueba

α = 0,05 dice: si la hipótesis nula es verdadera, esta prueba la rechazará erróneamente el 5% de las veces.

Ejecuta veinte pruebas independientes con datos que no contienen nada. Cada una se comporta como debe. Cada una tiene un 95% de probabilidades de no encontrar nada, de forma correcta. Pero la probabilidad de que las veinte se comporten correctamente es

0,9520 = 0,358

por lo que la probabilidad de que al menos una dé la alarma es del 64,2%. No es un riesgo: es el resultado más probable. Veinte pruebas sobre ruido puro producen un resultado significativo la mayoría de las veces, y ese resultado significativo tendrá un valor p inferior a 0,05, un intervalo de confianza que excluye el cero y todas las demás marcas de un hallazgo real, porque es indistinguible de uno.

Llévalo más lejos: con cuarenta pruebas la probabilidad es del 87%; con cien, del 99,4%. Cualquiera que ejecute suficientes comparaciones tiene un descubrimiento garantizado, y el descubrimiento es la propia aritmética.

La solución aritmética y por qué no es suficiente

La corrección es tan sencilla como el problema. Si vas a ejecutar m pruebas y quieres que la probabilidad de obtener algún falso positivo se mantenga en el 5%, evalúa cada una con α/m en su lugar. En eso consiste la corrección de Bonferroni: para veinte pruebas, exige p < 0,0025 en lugar de p < 0,05.

Introduce 0,0025 en la casilla α de la t-test tool y observa lo que le ocurre al valor crítico: el listón de lo «significativo» se aleja, y los resultados que superaban holgadamente la línea antigua ya no lo hacen. Ese es el precio, y es real: un umbral más estricto implica pasar por alto efectos genuinos. Existen correcciones más moderadas que compensan los dos errores de forma distinta, pero cada una de ellas cuesta potencia, porque aquí no se obtiene nada gratis.

El problema más profundo es que la corrección necesita m, y m suele ser imposible de conocer. No es el número de pruebas del artículo: es el número de pruebas que se ejecutaron. Cada subgrupo que no llegó a la redacción final, cada medida de resultado que se probó y descartó, cada elección sobre qué valores atípicos excluir, es una comparación. Un estudio que informa de una sola prueba puede haber tomado cincuenta decisiones, y el lector no tiene forma de contarlas.

A esto apuntaba Ioannidis en 2005 con el título intencionadamente contundente Why Most Published Research Findings Are False. Su argumento no es que los investigadores hagan trampa. Es que cuando muchos grupos evalúan muchas hipótesis —la mayoría de las cuales son falsas desde el principio—, los hallazgos significativos que salen a la luz están dominados por los falsos, y ninguna prueba individual de ese conjunto está haciendo nada mal.

En qué fijarse en su lugar

Tres hábitos que sobreviven a esto, todos los cuales te pueden mostrar las herramientas de este sitio.

Fíjate en el tamaño, no en el veredicto. Un valor p responde a «¿podría ser esto ruido?» y a nada más. No dice nada sobre cómo de grande es el efecto o si resulta relevante. La herramienta confidence interval existe porque un intervalo aporta ambas cosas: dónde se ubica probablemente el efecto y con qué precisión lo conoces. Un resultado significativo con un intervalo que va desde «trivial» hasta «enorme» apenas te ha dicho nada, y su valor p lo oculta.

Pregúntate dónde reside la diferencia. Una prueba de chi-cuadrado que resulta significativa te dice que una tabla no ajusta, pero no qué parte ha fallado. La residuals tool expone el mismo punto de forma estructural: el estadístico global es un resumen, mientras que la información está en las celdas. Un hallazgo que no puedes localizar suele ser un hallazgo que no puedes replicar.

Cuenta las comparaciones antes de mirar. Decidir qué vas a evaluar, y cuántas cosas, antes de ver los datos es la única forma de que esto funcione: porque, tras la llegada de los datos, cualquier umbral es negociable y la negociación es invisible. El prerregistro es la única vía para hacer de m un número conocido.

El 0,0002982 que la herramienta mostró al principio es un valor p realmente pequeño. También es solo un número de una única prueba, y su significado depende por completo de algo que el propio número no puede decirte: cuántas otras pruebas ejecutaste para obtenerlo.