t検定が答える問い
答えるのは1つの狭い問いだけです。2つの群の平均が本当に等しいとしたら、無作為な標本抽出で、測定したのと同じかそれ以上の差がどれくらいの頻度で生じるか。これがp値です。仮説が正しい確率ではありません。
どれを選ぶか
- 対応あり:同じ対象を前後2回測った場合。差を検定するので個体差のばらつきが消え、検出力がずっと高くなります。本当に対応のあるデータなら必ずこれを使います。
- Welchの2標本:独立した2群で、分散が等しいとは仮定しません。独立な群に対する妥当な既定の選択です。
- Studentの2標本:同じですが分散をプールします。群の大きさとばらつきが近いときにだけ意味があり、Welchに対する利得はごくわずかです。
- 1標本:1つの群を固定の基準値と比べます。
計算例
群A:5.1、5.3、4.9、5.0、5.2。群B:4.5、4.7、4.3、4.4、4.6。
- 平均は5.10と4.50、標準偏差はどちらも0.158。
- 差の標準誤差:√(0.025/5 + 0.025/5) = 0.1。
- t = 0.60 ÷ 0.1 = 6.00、自由度8。
- 両側のp = 0.00032。
これだけ密集した5個ずつの群で、これほど大きな差が偶然に現れるのは1万回に3回ほどです。
片側か両側か
片方向の差に意味がないと言い切れる場合を除き、両側を使い、データを見る前に決めます。あとから0.05を下回るために片側へ変えるのはp値を無償で半分にする行為で、この検定のもっとも一般的な乱用です。
検定が前提にしていること
- 観測が独立であること。もっとも破られやすい前提で、どんな検定でも救えません。同じ対象の繰り返し測定は独立ではありません。
- おおよそ正規であるか、数が十分にあること。1群30ほどを超えると正規性からのずれに強くなります。それ以下では強い歪みや外れ値が効いてきます。
- Welchを使うなら分散が等しいという前提は不要です。
明らかに歪んだ小標本には、Mann-WhitneyやWilcoxonのほうが向いています。
効果量も併せて報告する
p値は差の大きさを何も語りません。標本が大きければ些細な差でも有意になり、小さければ大きな差でも有意にならないことがあります。平均の差を信頼区間つきで示し、Cohenのd(差 ÷ プールした標準偏差。0.2が小、0.5が中、0.8が大)も添えてください。上の例ではdは3.8で、きわめて大きい値です。
ツール
t検定計算機は対応あり・2標本・Welchの検定を実行し、t、自由度、p値を出します。標準偏差計算機は各群の平均とばらつきを個別に出します。