O que um teste t responde
Ele faz uma única pergunta, bem estreita: se os dois grupos realmente tivessem a mesma média, com que frequência a amostragem aleatória produziria uma diferença pelo menos tão grande quanto a que você mediu? Isso é o valor p. Não é a probabilidade de a sua hipótese ser verdadeira.
Escolher o certo
- Emparelhado: os mesmos sujeitos medidos duas vezes, antes e depois. Analisa-se as diferenças, o que remove a variação entre sujeitos e deixa o teste muito mais sensível. Use sempre que os dados realmente forem emparelhados.
- De Welch, duas amostras: dois grupos independentes, sem supor que as variâncias são iguais. É a escolha sensata por padrão para grupos independentes.
- De Student, duas amostras: o mesmo, mas combinando as variâncias. Só vale a pena quando os grupos têm tamanho e dispersão parecidos, e ganha muito pouco em relação ao de Welch.
- De uma amostra: um grupo contra um valor de referência fixo.
Um exemplo
Grupo A: 5,1, 5,3, 4,9, 5,0, 5,2. Grupo B: 4,5, 4,7, 4,3, 4,4, 4,6.
- Médias 5,10 e 4,50, cada uma com desvio padrão de 0,158.
- Erro padrão da diferença: √(0,025/5 + 0,025/5) = 0,1.
- t = 0,60 ÷ 0,1 = 6,00, com 8 graus de liberdade.
- p = 0,00032 em duas caudas.
Uma diferença tão grande entre grupos de cinco dados tão juntos apareceria por acaso umas três vezes em dez mil.
Uma cauda ou duas
Use duas caudas, a não ser que uma diferença num sentido não signifique nada para você, e decida antes de ver os dados. Mudar para uma cauda depois para ficar abaixo de 0,05 corta o valor p pela metade de graça, e é a forma mais comum de abusar desse teste.
O que o teste supõe
- Observações independentes. É a suposição que mais se quebra, e nenhum teste salva isso. Medidas repetidas do mesmo sujeito não são independentes.
- Dados mais ou menos normais, ou em quantidade suficiente. Acima de uns 30 por grupo o teste aguenta bem a falta de normalidade; abaixo disso, assimetria forte ou valores extremos importam.
- Nenhuma suposição de variâncias iguais, se você usar Welch.
Amostras pequenas com assimetria clara são melhor servidas por Mann-Whitney ou Wilcoxon.
Informe também o tamanho do efeito
Um valor p não diz nada sobre o tamanho da diferença. Com amostras grandes, uma diferença irrelevante sai significativa; com amostras pequenas, uma diferença grande pode não sair. Dê a diferença entre as médias com o intervalo de confiança e o d de Cohen (diferença ÷ desvio padrão combinado, onde 0,2 é pequeno, 0,5 médio e 0,8 grande). No exemplo acima o d é 3,8, que é enorme.
Ferramentas
A Calculadora de teste t faz os testes emparelhado, de duas amostras e de Welch, e dá t, os graus de liberdade e o valor p. A Calculadora de desvio padrão dá a média e a dispersão de cada grupo separadamente.