Ce qu’un test t répond
Il pose une seule question, très étroite : si les deux groupes avaient réellement la même moyenne, à quelle fréquence un tirage aléatoire produirait-il un écart au moins aussi grand que celui que vous avez mesuré ? C’est la valeur p. Ce n’est pas la probabilité que votre hypothèse soit vraie.
Choisir le bon
- Apparié : les mêmes sujets mesurés deux fois, avant et après. On teste les différences, ce qui élimine la variabilité entre sujets et rend le test bien plus sensible. À utiliser dès que les données sont réellement appariées.
- Welch, deux échantillons : deux groupes indépendants, sans supposer les variances égales. C’est le choix par défaut raisonnable pour des groupes indépendants.
- Student, deux échantillons : le même, mais avec les variances mises en commun. Ne vaut la peine que si les groupes ont des effectifs et des dispersions proches, et n’apporte presque rien face à Welch.
- Un échantillon : un groupe contre une valeur de référence fixe.
Un exemple
Groupe A : 5,1, 5,3, 4,9, 5,0, 5,2. Groupe B : 4,5, 4,7, 4,3, 4,4, 4,6.
- Moyennes 5,10 et 4,50, chacune avec un écart type de 0,158.
- Erreur type de la différence : √(0,025/5 + 0,025/5) = 0,1.
- t = 0,60 ÷ 0,1 = 6,00, avec 8 degrés de liberté.
- p = 0,00032 en bilatéral.
Un écart aussi grand entre deux groupes de cinq valeurs aussi resserrées apparaîtrait par hasard environ trois fois sur dix mille.
Unilatéral ou bilatéral
Prenez bilatéral, sauf si un écart dans un sens n’aurait aucun sens pour vous, et décidez-le avant de voir les données. Passer en unilatéral après coup pour descendre sous 0,05 divise la valeur p par deux gratuitement, et c’est l’abus le plus courant de ce test.
Ce que le test suppose
- Des observations indépendantes. C’est l’hypothèse la plus souvent violée, et aucun test ne la rattrape. Des mesures répétées du même sujet ne sont pas indépendantes.
- Des données à peu près normales, ou assez nombreuses. Au-delà d’une trentaine par groupe, le test supporte bien la non-normalité ; en dessous, une forte asymétrie ou des valeurs extrêmes comptent.
- Aucune hypothèse d’égalité des variances, si vous utilisez Welch.
Pour de petits échantillons nettement asymétriques, Mann-Whitney ou Wilcoxon conviennent mieux.
Donnez aussi la taille d’effet
Une valeur p ne dit rien de l’ampleur de l’écart. Avec de grands échantillons, un écart négligeable devient significatif ; avec de petits, un grand écart peut ne pas l’être. Donnez la différence des moyennes avec son intervalle de confiance, et le d de Cohen (différence ÷ écart type combiné, où 0,2 est faible, 0,5 moyen et 0,8 fort). Dans l’exemple ci-dessus, d vaut 3,8, ce qui est énorme.
Outils
Le Calculateur de test t exécute les tests apparié, à deux échantillons et de Welch, et donne t, les degrés de liberté et la valeur p. Le Calculateur d’écart type donne la moyenne et la dispersion de chaque groupe séparément.