Was ein t-Test beantwortet
Er stellt eine einzige, enge Frage: hätten die beiden Gruppen wirklich denselben Mittelwert, wie oft würde eine Zufallsstichprobe dann einen Unterschied erzeugen, der mindestens so groß ist wie der gemessene? Das ist der p-Wert. Er ist nicht die Wahrscheinlichkeit, dass deine Hypothese zutrifft.
Den richtigen wählen
- Gepaart: dieselben Probanden zweimal gemessen, vorher und nachher. Man testet die Differenzen, was die Streuung zwischen den Probanden entfernt und den Test deutlich empfindlicher macht. Nimm ihn immer, wenn die Daten wirklich gepaart sind.
- Welch, zwei Stichproben: zwei unabhängige Gruppen, ohne gleiche Varianzen anzunehmen. Das ist die sinnvolle Standardwahl für unabhängige Gruppen.
- Student, zwei Stichproben: dasselbe, aber mit gepoolten Varianzen. Lohnt nur, wenn Umfang und Streuung der Gruppen ähnlich sind, und bringt gegenüber Welch sehr wenig.
- Eine Stichprobe: eine Gruppe gegen einen festen Referenzwert.
Ein Rechenbeispiel
Gruppe A: 5,1, 5,3, 4,9, 5,0, 5,2. Gruppe B: 4,5, 4,7, 4,3, 4,4, 4,6.
- Mittelwerte 5,10 und 4,50, jeweils mit einer Standardabweichung von 0,158.
- Standardfehler der Differenz: √(0,025/5 + 0,025/5) = 0,1.
- t = 0,60 ÷ 0,1 = 6,00, mit 8 Freiheitsgraden.
- Zweiseitig p = 0,00032.
Ein so großer Unterschied zwischen zwei so engen Fünfergruppen käme zufällig etwa dreimal von zehntausend vor.
Einseitig oder zweiseitig
Nimm zweiseitig, außer ein Unterschied in einer Richtung wäre für dich bedeutungslos, und entscheide das, bevor du die Daten siehst. Hinterher auf einseitig zu wechseln, um unter 0,05 zu kommen, halbiert den p-Wert gratis und ist der häufigste Missbrauch dieses Tests.
Was der Test voraussetzt
- Unabhängige Beobachtungen. Diese Voraussetzung wird am häufigsten verletzt, und kein Test kann das retten. Wiederholte Messungen desselben Probanden sind nicht unabhängig.
- Etwa normalverteilte Daten oder genügend davon. Oberhalb von etwa 30 pro Gruppe steckt der Test fehlende Normalität gut weg; darunter fallen starke Schiefe oder Ausreißer ins Gewicht.
- Keine Annahme gleicher Varianzen, wenn du Welch nimmst.
Für klar schiefe kleine Stichproben sind Mann-Whitney oder Wilcoxon besser geeignet.
Auch die Effektstärke angeben
Ein p-Wert sagt nichts darüber, wie groß der Unterschied ist. Bei großen Stichproben wird ein belangloser Unterschied signifikant, bei kleinen bleibt ein großer es womöglich nicht. Gib die Differenz der Mittelwerte mit Konfidenzintervall an, dazu Cohens d (Differenz ÷ gepoolte Standardabweichung, wobei 0,2 klein, 0,5 mittel und 0,8 groß ist). Im Beispiel oben ist d gleich 3,8, also enorm.
Werkzeuge
Der t-Test-Rechner rechnet den gepaarten, den Zweistichproben- und den Welch-Test und liefert t, die Freiheitsgrade und den p-Wert. Der Standardabweichungsrechner liefert Mittelwert und Streuung jeder Gruppe einzeln.