Prueba t de Student

Realiza pruebas de hipótesis para determinar si las medias difieren significativamente.

Cargando simulación interactiva...

qué significa realmente p < 0.05 🖖

El valor p es la probabilidad de observar un estadístico de prueba al menos tan extremo como el tuyo, suponiendo que H₀ es verdadera. NO es la probabilidad de que H₀ sea verdadera. Un valor p de 0.03 significa: si la hipótesis nula fuera cierta, verías un resultado tan extremo solo el 3% de las veces por azar — lo bastante inusual como para rechazarla. Pero una significancia del 5% implica que 1 de cada 20 pruebas rechazará una hipótesis nula verdadera por pura casualidad (error tipo I). Un α más pequeño es más estricto, pero aumenta los errores tipo II (no detectar efectos reales). El gráfico lo muestra directamente: si la línea roja está más allá del umbral ámbar, p < α.

Una relación señal-ruido para las medias 🖖

En el fondo, el estadístico t no es más que una relación señal-ruido: la diferencia entre las medias de los grupos (la señal) dividida por el error estándar (el ruido del muestreo aleatorio). Un t grande indica que la diferencia destaca sobre la dispersión; un t pequeño podría deberse fácilmente al azar. La lección práctica: la misma diferencia de medias resulta más convincente cuanto mayores son las muestras o menor su dispersión, porque eso reduce el ruido del denominador.

Los grados de libertad de Welch no son enteros 🖖

Uno esperaría que los grados de libertad fueran un entero limpio: el número de piezas de información independientes. Pero la prueba t de Welch usa la fórmula de Welch-Satterthwaite, que suele devolver un valor fraccionario como df = 17.4. Es una aproximación deliberada: cuando las varianzas son desiguales no existe un df entero exacto, así que el método interpola para ajustarse lo más posible a la distribución real. Por eso el df de Welch suele diferir del clásico n₁ + n₂ − 2.

LA PRUEBA t — QUÉ DISEÑO, Y QUÉ DICE REALMENTE EL VEREDICTO

¿En qué caso de la prueba t está?

Aquí todo lo deciden dos preguntas. Primero el diseño: ¿compara un grupo con un valor afirmado, o dos grupos entre sí? Eso fija la fórmula y los grados de libertad. Segundo la lectura: una p pequeña rechaza la hipótesis nula, pero una grande no la demuestra; casi siempre significa que la muestra era demasiado pequeña para distinguir. Ambos errores son más frecuentes que los de cálculo.

Una muestra frente a un valor afirmado: la evidencia supera el listón t = (x̄ − μ₀) / (s/√n)
Una diferencia menor: sin veredicto, que no es lo mismo que sin efecto p > α ⇏ H₀
Dos grupos independientes: Welch, sin suponer varianzas iguales SE = √(s₁²/n₁ + s₂²/n₂)
La misma comparación, sin potencia: una diferencia que la muestra no resuelve 1 − β ∝ δ√n/s

01

Una muestra frente a un valor afirmado: la evidencia supera el listón

Lo que sabe: Un grupo de medidas y un número con el que compararlas. El estadístico es t = (x̄ − μ₀)/(s/√n) con n − 1 grados de libertad.

Estadístico: t = (x̄ − μ₀) / (s/√n)

Ejemplo resuelto: x̄ = 78 frente a μ₀ = 72 con s = 8 y n = 30 → SE = 1,461, t = 4,108, df = 29, p = 0,0003

Abrir este caso: Examen (rechaza H₀)
Una muestra frente a un valor afirmado: la evidencia supera el listón. La t observada cae muy fuera de los valores críticos, dentro de la región de rechazo sombreada. Un grupo de medidas y un número con el que compararlas. El estadístico es t = (x̄ − μ₀)/(s/√n) con n − 1 grados de libertad.
La t observada cae muy fuera de los valores críticos, dentro de la región de rechazo sombreada.

02

Una diferencia menor: sin veredicto, que no es lo mismo que sin efecto

Lo que sabe: El mismo diseño y la misma n, pero la diferencia es pequeña frente al ruido. La p queda por encima de α, así que no se rechaza la nula.

Estadístico: p > α ⇏ H₀

Ejemplo resuelto: x̄ = 73 frente a μ₀ = 72 con s = 8 y n = 30 → t = 0,685, p = 0,499

Abrir este caso: Examen (no rechaza)
Una diferencia menor: sin veredicto, que no es lo mismo que sin efecto. La t observada queda entre los valores críticos, en la zona donde la prueba no puede decidir. El mismo diseño y la misma n, pero la diferencia es pequeña frente al ruido. La p queda por encima de α, así que no se rechaza la nula.
La t observada queda entre los valores críticos, en la zona donde la prueba no puede decidir.

03

Dos grupos independientes: Welch, sin suponer varianzas iguales

Lo que sabe: Dos muestras separadas, cada una con su media, su dispersión y su tamaño. SE = √(s₁²/n₁ + s₂²/n₂), y los grados de libertad salen fraccionarios.

Estadístico: SE = √(s₁²/n₁ + s₂²/n₂)

Ejemplo resuelto: 82 ± 10 en 40 sujetos frente a 75 ± 12 en 38 → SE = 2,508, t = 2,791, df = 72,1, p = 0,0067

Abrir este caso: Ensayo clínico (sig.)
Dos grupos independientes: Welch, sin suponer varianzas iguales. Dos dispersiones, dos tamaños y un df que no es entero: la firma de Welch. Dos muestras separadas, cada una con su media, su dispersión y su tamaño. SE = √(s₁²/n₁ + s₂²/n₂), y los grados de libertad salen fraccionarios.
Dos dispersiones, dos tamaños y un df que no es entero: la firma de Welch.

04

La misma comparación, sin potencia: una diferencia que la muestra no resuelve

Lo que sabe: Otra vez dos grupos, pero más pequeños y con menos distancia entre ellos. El resultado no se distingue del ruido.

Estadístico: 1 − β ∝ δ√n/s

Ejemplo resuelto: 77 ± 11 en 25 sujetos frente a 75 ± 12 en 28 → SE = 3,160, t = 0,633, df = 51,0, p = 0,530

Abrir este caso: Ensayo clínico (no sig.)
La misma comparación, sin potencia: una diferencia que la muestra no resuelve. La t observada queda casi en el centro de la distribución, donde vive casi toda la probabilidad. Otra vez dos grupos, pero más pequeños y con menos distancia entre ellos. El resultado no se distingue del ruido.
La t observada queda casi en el centro de la distribución, donde vive casi toda la probabilidad.

Problema resuelto al detalle

  1. Una muestra de 30 con puntuación 78 donde la media poblacional es 72 5 pasos

    Una muestra de 30 obtiene una media de 78 donde la media poblacional afirmada es 72, con s = 8. Realiza la prueba y luego responde a la pregunta que el p-valor no responde.

    1. Una sola media es una estimación ruidosa, y su ruido es el error estándar —la dispersión de la muestra dividida por la raíz del tamaño de la muestra. Las muestras más grandes no hacen que los individuos sean menos variables; hacen que la media sea menos variable.

    2. El estadístico t pregunta cuántos errores estándar separan lo que observaste de lo que se afirmó. Es una distancia medida en unidades de su propia incertidumbre.

    3. Los grados de libertad son uno menos que el tamaño de la muestra, porque la media muestral ya se ha empleado en estimar el centro. La calculadora de arriba muestra tanto esto como el estadístico.

    4. El p-valor es la probabilidad de obtener un |t| tan grande si la afirmación fuera cierta. La herramienta muestra 0.0002982 —aproximadamente 3 de cada 10 000.

    5. Ahora la parte sobre la que el p-valor no dice nada: cuán grande es la diferencia. La d de Cohen divide entre la dispersión de los datos en lugar de la dispersión de la media, por lo que no disminuye a medida que crece la muestra.

    Respuesta

    t = 4.1079 con 29 df, p = 0.0002982. El tamaño del efecto es d = 0.75, una diferencia realmente grande. Mantener ambos separados es toda la disciplina: p responde a "¿podría ser esto ruido?", y se puede hacer arbitrariamente pequeño recogiendo más datos, porque n aparece en el error estándar. d responde a "¿importa?", y no varía con n. Un estudio con n = 10 000 puede reportar p < 0.001 para un d de 0.02 —estadísticamente seguro, prácticamente nada.

Ruta de aprendizaje

¿Cuándo es real una diferencia?

Lleva a ANOVA

Referencias (1)

Problemas de ejemplo

  • Examen (rechaza H₀) - Una clase con una media de 78 frente al objetivo de 72, dispersión 8, treinta estudiantes: t = 4,1079 y p = 0,0002982. La diferencia es de seis puntos sobre una dispersión de ocho. No supone un efecto inmenso, pero resulta concluyente de todos modos. La significación la establece el error estándar de 1,4606, no el tamaño de esa diferencia.
  • Examen (no rechaza) - Cambia la media de la clase de 78 a 73 y nada más: misma dispersión, los mismos treinta estudiantes. El valor p salta de tres de cada diez mil a 0,499. La mitad de las clases extraídas de una población con una media real de 72 quedarían al menos a esta distancia. No rechazar la hipótesis no demuestra la ausencia de diferencia. Significa que los datos declinan pronunciarse.
  • Ensayo clínico (sig.) - Observa los grados de libertad: 72,137, no 76. Cuarenta pacientes y treinta y ocho sumarían 76 según la t de Student, pero las dos dispersiones difieren, 10 frente a 12. La corrección de Welch penaliza este desajuste en fracciones de grado. Tenemos t = 2,7912 frente a un valor crítico de 1,9934, por lo que p = 0,006716 y el resultado se mantiene.
  • Ensayo clínico (no sig.) - El mismo ensayo con una diferencia menor y menos pacientes: 2 puntos en lugar de 7, con 25 y 28 en vez de 40 y 38. El error estándar asciende a 3,1596. Como supera a la diferencia que mide, resulta t = 0,633 y p = 0,5296. Ningún dato indica aquí que el fármaco no funcione. Solo demuestra que el ensayo fue demasiado pequeño para averiguarlo.