Qué responde una prueba t
Hace una sola pregunta, muy concreta: si los dos grupos tuvieran de verdad la misma media, ¿con qué frecuencia el muestreo aleatorio daría una diferencia al menos tan grande como la que has medido? Eso es el valor p. No es la probabilidad de que tu hipótesis sea cierta.
Elegir la correcta
- Emparejada: los mismos sujetos medidos dos veces, antes y después. Se analizan las diferencias, lo que elimina la variación entre sujetos y hace la prueba mucho más sensible. Úsala siempre que los datos estén realmente emparejados.
- De Welch, dos muestras: dos grupos independientes, sin suponer que las varianzas coinciden. Es la opción sensata por defecto para grupos independientes.
- De Student, dos muestras: lo mismo, pero combinando las varianzas. Solo merece la pena si los grupos tienen tamaño y dispersión parecidos, y gana muy poco frente a Welch.
- De una muestra: un grupo frente a un valor de referencia fijo.
Un ejemplo
Grupo A: 5,1, 5,3, 4,9, 5,0, 5,2. Grupo B: 4,5, 4,7, 4,3, 4,4, 4,6.
- Medias 5,10 y 4,50, cada una con una desviación estándar de 0,158.
- Error estándar de la diferencia: √(0,025/5 + 0,025/5) = 0,1.
- t = 0,60 ÷ 0,1 = 6,00, con 8 grados de libertad.
- p = 0,00032 a dos colas.
Una diferencia tan grande entre grupos de cinco datos tan agrupados saldría por azar unas tres veces entre diez mil.
Una cola o dos
Usa dos colas salvo que una diferencia en un sentido no te diga nada, y decídelo antes de ver los datos. Pasarse a una cola después para bajar de 0,05 reduce el valor p a la mitad de gratis, y es la forma más común de abusar de esta prueba.
Qué supone la prueba
- Observaciones independientes. Es el supuesto que más se incumple, y no hay prueba que lo salve. Medidas repetidas del mismo sujeto no son independientes.
- Datos más o menos normales, o suficientes. Por encima de unos 30 por grupo la prueba resiste bien la falta de normalidad; por debajo, una asimetría fuerte o los valores extremos sí importan.
- Ningún supuesto de igualdad de varianzas, si usas Welch.
Para muestras pequeñas con asimetría clara van mejor Mann-Whitney o Wilcoxon.
Informa también del tamaño del efecto
Un valor p no dice nada de lo grande que es la diferencia. Con muestras grandes, una diferencia irrelevante sale significativa; con muestras pequeñas, una diferencia grande puede no salirlo. Da la diferencia de medias con su intervalo de confianza y la d de Cohen (diferencia ÷ desviación estándar combinada, donde 0,2 es pequeño, 0,5 medio y 0,8 grande). En el ejemplo de arriba la d es 3,8, que es enorme.
Herramientas
La Calculadora de prueba t hace las pruebas emparejada, de dos muestras y de Welch, y da t, los grados de libertad y el valor p. La Calculadora de desviación estándar da la media y la dispersión de cada grupo por separado.