На что отвечает t-тест
Он задаёт один узкий вопрос: если бы у двух групп на самом деле было одинаковое среднее, как часто случайная выборка давала бы различие не меньше измеренного? Это и есть p-значение. Это не вероятность того, что ваша гипотеза верна.
Выбор подходящего
- Парный: одни и те же объекты измерены дважды, до и после. Проверяются разности, что убирает вариацию между объектами и делает тест гораздо чувствительнее. Используйте его всякий раз, когда данные действительно парные.
- Двухвыборочный Уэлча: две независимые группы без предположения о равенстве дисперсий. Разумный выбор по умолчанию для независимых групп.
- Двухвыборочный Стьюдента: то же, но с объединением дисперсий. Имеет смысл, только когда группы близки по размеру и разбросу, и выигрывает у Уэлча очень мало.
- Одновыборочный: одна группа против фиксированного эталонного значения.
Разобранный пример
Группа A: 5,1, 5,3, 4,9, 5,0, 5,2. Группа B: 4,5, 4,7, 4,3, 4,4, 4,6.
- Средние 5,10 и 4,50, у каждой стандартное отклонение 0,158.
- Стандартная ошибка разности: √(0,025/5 + 0,025/5) = 0,1.
- t = 0,60 ÷ 0,1 = 6,00 при 8 степенях свободы.
- Двустороннее p = 0,00032.
Такая большая разница между столь плотными группами по пять точек возникала бы случайно примерно три раза из десяти тысяч.
Один хвост или два
Используйте двусторонний тест, если только различие в одну сторону не бессмысленно для вас, и решайте это до того, как увидите данные. Переход на односторонний задним числом, чтобы опуститься ниже 0,05, бесплатно вдвое уменьшает p-значение и является самым частым злоупотреблением этими тестами.
Что тест предполагает
- Независимые наблюдения. Это предположение нарушают чаще всего, и никакой тест его не спасёт. Повторные измерения одного объекта не независимы.
- Примерно нормальные данные или их достаточно много. Выше примерно 30 на группу тест устойчив к ненормальности; ниже этого сильная асимметрия или выбросы имеют значение.
- Никакого предположения о равенстве дисперсий, если вы используете Уэлча.
Для явно асимметричных малых выборок лучше подходят критерии Манна — Уитни или Уилкоксона.
Указывайте и размер эффекта
p-значение ничего не говорит о величине различия. При больших выборках ничтожное различие значимо; при малых большое может не быть значимым. Приводите разность средних с доверительным интервалом и d Коэна (разность ÷ объединённое стандартное отклонение, где 0,2 — малый эффект, 0,5 — средний, 0,8 — большой). В примере выше d равно 3,8 — это огромно.
Инструменты
Калькулятор t-критерия выполняет парный, двухвыборочный тест и тест Уэлча и даёт t, число степеней свободы и p-значение. Калькулятор стандартного отклонения даёт среднее и разброс каждой группы по отдельности.