t 검정이 답하는 것
묻는 것은 한 가지 좁은 질문뿐입니다. 두 집단의 평균이 실제로 같다면, 무작위 표본추출로 측정한 것만큼 큰 차이가 얼마나 자주 나타나겠는가. 그것이 p값입니다. 가설이 참일 확률이 아닙니다.
알맞은 검정 고르기
- 대응표본: 같은 대상을 전후로 두 번 측정한 경우. 차이를 검정하므로 대상 간 변동이 사라지고 검정이 훨씬 민감해집니다. 자료가 실제로 대응된다면 항상 이것을 쓰세요.
- Welch 이표본: 독립된 두 집단에 대해 분산이 같다고 가정하지 않습니다. 독립 집단에는 이것이 합리적인 기본 선택입니다.
- Student 이표본: 같지만 분산을 합쳐서 씁니다. 두 집단의 크기와 퍼짐이 비슷할 때만 의미가 있고, Welch에 비해 얻는 것은 아주 적습니다.
- 일표본: 한 집단을 고정된 기준값과 비교합니다.
계산 예
A 집단: 5.1, 5.3, 4.9, 5.0, 5.2. B 집단: 4.5, 4.7, 4.3, 4.4, 4.6.
- 평균은 5.10과 4.50, 표준편차는 둘 다 0.158.
- 차이의 표준오차: √(0.025/5 + 0.025/5) = 0.1.
- t = 0.60 ÷ 0.1 = 6.00, 자유도 8.
- 양측 p = 0.00032.
이렇게 촘촘한 다섯 개씩의 집단에서 이만한 차이가 우연히 나타나는 일은 1만 번에 세 번쯤입니다.
단측인가 양측인가
한쪽 방향의 차이가 아무 의미도 없는 경우를 빼면 양측을 쓰고, 자료를 보기 전에 정하세요. 나중에 0.05 아래로 내려가려고 단측으로 바꾸는 것은 p값을 공짜로 절반으로 만드는 일이고, 이 검정에서 가장 흔한 오용입니다.
검정이 전제하는 것
- 관측의 독립성. 가장 자주 깨지는 전제이며 어떤 검정으로도 메울 수 없습니다. 같은 대상의 반복 측정은 독립이 아닙니다.
- 대체로 정규인 자료 또는 충분한 수. 집단당 30개 정도를 넘으면 정규성에서 벗어나도 잘 견디고, 그 아래에서는 강한 치우침이나 이상치가 영향을 줍니다.
- Welch를 쓰면 분산이 같다는 전제는 없습니다.
분명히 치우친 작은 표본에는 Mann-Whitney나 Wilcoxon이 더 알맞습니다.
효과 크기도 함께 보고하기
p값은 차이가 얼마나 큰지에 대해 아무 말도 하지 않습니다. 표본이 크면 사소한 차이도 유의해지고, 작으면 큰 차이도 유의하지 않을 수 있습니다. 평균 차이를 신뢰구간과 함께 제시하고, Cohen의 d(차이 ÷ 합동 표준편차, 0.2는 작음, 0.5는 중간, 0.8은 큼)도 함께 쓰세요. 위 예에서 d는 3.8로 매우 큽니다.
도구
t 검정 계산기는 대응표본·이표본·Welch 검정을 수행하고 t, 자유도, p값을 줍니다. 표준편차 계산기는 각 집단의 평균과 퍼짐을 따로 보여 줍니다.