거의 모든 실험은 같은 질문으로 끝납니다: 이 집단들이 정말 다른가, 아니면 숫자가 그렇게 나온 것뿐인가? 버전 B의 전환이 조금 나았고, 요금제 C의 사용자가 조금 더 쓰고, 새 프로세스가 몇 초를 줄였습니다. 각각이 집단 비교이며 — 이 방법 family 전체가 진짜 차이를 운 좋은 표본에서 갈라내려고 존재합니다.
함정은 "집단을 비교하라"가 하나의 검정이 아니라는 점입니다. 그것은 의사결정 나무입니다. 두 집단인가 여럿인가? 독립인가 대응인가? 정규인가 치우쳤는가? 각 가지가 다른 방법으로 이어지고, 잘못된 가지를 고르면 권위 있어 보이지만 아무 의미 없는 p값이 나옵니다. 이 가이드는 그 나무 전체를 걷습니다.
Note
검정을 정하는 세 질문
어떤 검정을 돌리기 전에, 세 질문이 무엇이 유효한지 결정합니다. 순서대로 답하면 선택이 저절로 됩니다.
- 1집단이 몇 개인가? 둘이면 t검정, 셋 이상이면 ANOVA로 향합니다.
- 2집단이 독립인가 대응인가? 같은 사람의 전후는 대응, 별개 코호트는 독립입니다.
- 3데이터가 대략 정규인가, 이상치로 치우쳤는가? 정규면 고전적 모수 검정, 치우쳤으면 비모수 대안으로 향합니다.
Tip
두 집단: t검정
정확히 두 집단이면 t검정이 평균 간 격차를 각 집단 내 퍼짐과 저울질합니다. 지저분한 두 집단 사이의 큰 차이는 아무것도 아닐 수 있고, 촘촘한 두 집단 사이의 작은 차이는 진짜일 수 있습니다.
| 유형 | 비교 대상 |
|---|---|
| 일표본 | 한 집단의 평균을 알려진 값과 |
| 독립(이표본) | 서로 다른 두 집단의 평균 |
| 대응 | 같은 대상의 전 vs 후 |
두 측정이 같은 사람·항목에서 나올 땐 언제나 대응 검정을 쓰세요 — 개인 간 변동을 제거해 훨씬 강력합니다. 분산이 다르면 Welch 보정이 안전한 기본값입니다. 전용 t검정 가이드가 가정과 결과 읽기를 깊이 다룹니다.
세 집단 이상: ANOVA
여러 집단일 때의 본능은 모든 쌍에 t검정을 돌리는 것입니다. 그러지 마세요 — 각 검정엔 거짓 양성 위험이 있고 여섯 번의 비교가 그걸 쌓습니다. ANOVA(분산분석)는 집단 평균 사이의 변동을 집단 내 변동과 비교해 모든 집단을 한 번에 검정합니다.
| 설계 | 언제 |
|---|---|
| 일원 ANOVA | 요인 하나(예: 요금제 등급) |
| 이원 ANOVA | 요인 둘과 그 상호작용 |
| 반복측정 | 같은 대상을 조건에 걸쳐 |
Watch out
데이터가 정규가 아닐 때: 비모수 검정
t검정과 ANOVA는 대략 정규인 데이터를 가정합니다. 심하게 치우쳤거나, 강한 이상치가 있거나, 평점 척도이거나, 표본이 아주 작으면 평균은 공정한 요약이 못 됩니다. 순위 기반 검정은 값의 순서를 대신 비교하며, 평균이 못 할 때에도 정직합니다.
| 모수 검정 | 비모수 대응 |
|---|---|
| 독립 t검정 | Mann-Whitney U |
| 대응 t검정 | Wilcoxon 부호순위 |
| 일원 ANOVA | Kruskal-Wallis |
각각 평균 기반 비교를 순위 기반으로 바꿔 정규성 가정 없이 같은 질문에 답합니다. 정직한 대안이지만 — 데이터가 정말 정규면 모수 검정이 더 강력하니, 기본값으로 순위를 집지 마세요. 절충은 비모수 검정 가이드를 보세요.
유의성은 크기가 아니다
모든 비교는 p값을 반환하지만, p값은 '차이가 진짜인가?'에만 답합니다. '중요한가?'는 아무것도 말하지 않습니다. 표본이 충분히 크면 신경 쓸 필요 없이 작은 차이도 "유의"해집니다.
- 효과크기(Cohen's d, 에타제곱)는 차이가 실제로 얼마나 큰지 보고
- 신뢰구간은 참 격차의 그럴듯한 범위를 제공
- p값 옆에 둘 다 보고 — 크기 없는 유의성은 반쪽 답
Tip
다중비교 함정
모든 검정엔 거짓 양성 가능성이 있습니다. 0.05 임계로 스무 번 비교하면 평균적으로 하나의 "유의한" 결과가 순전한 우연으로 나타납니다. 많은 쌍을 검정하고, 반복해 엿보고, 하나가 걸릴 때까지 변수를 시도하는 것이 잡음을 신호로 발표하는 방식입니다.
Watch out
의사결정 표
| 상황 | 정규 데이터 | 치우침 / 작은 n |
|---|---|---|
| 독립 2집단 | 독립 t검정 | Mann-Whitney U |
| 대응 2측정 | 대응 t검정 | Wilcoxon 부호순위 |
| 독립 3집단 이상 | 일원 ANOVA + 사후 | Kruskal-Wallis |
| 요인 둘 동시 | 이원 ANOVA | (순위 기반 / 강건) |
이 표가 family 전체의 축소판입니다: 당신의 행으로 내려가 분포로 가로질러, 둘이 만나는 칸이 유효한 검정입니다.
SKARI Statistical Lab의 집단 비교
SKARI의 Statistical Lab은 비교를 — 전체 검정을 갖춘 가장 큰 — 독립된 family로 다루며, 선택과 가정 점검을 대신 해줍니다.
- Welch 보정이 있는 일표본·독립·대응 t검정
- 사후비교가 있는 일원·이원·반복측정 ANOVA
- 정규성이 실패할 때 제공되는 비모수 검정 — Mann-Whitney, Wilcoxon, Kruskal-Wallis
- p값이 아니라 확률을 원할 때의 베이지안 비교 방법
- 자동 정규성·분산 점검, 효과크기, 쉬운 말 해석
Takeaway
자주 묻는 질문
그냥 모든 쌍에 t검정을 돌리면 안 되나요?
안 됩니다 — 셋 이상이면 거짓 양성을 부풀립니다. 전체 오류율을 통제하는 사후검정과 함께 ANOVA를 쓰세요.
대응과 독립 중?
두 측정이 같은 대상(전/후)이면 대응, 집단이 별개 코호트면 독립입니다.
데이터가 충분히 정규인지 어떻게 아나요?
히스토그램이나 정규성 검정을 확인하세요. SKARI가 자동으로 점검하고 실패 시 비모수 검정으로 안내합니다.
차이의 크기만 중요하면?
효과크기와 그 신뢰구간을 보고하세요. 유의성은 진짜임을, 효과크기는 행동할 가치가 있는지를 알려줍니다.
핵심 요약
2집단
t검정
대응 여부
3집단+
ANOVA
이후 사후
치우침
순위
비모수
항상
효과
p 옆에
집단 비교는 계산보다 선택의 문제입니다. 집단을 세고, 대응 여부를 확인하고, 분포를 보면 올바른 검정이 따라옵니다 — 그런 다음 유의성을 효과크기와 함께 읽고, 여러 번 돌리면 보정하세요. 그러면 '이 집단들은 다르다'가 방어할 수 있는 주장이 됩니다.
Takeaway
t검정
두 집단 경우를 깊이
ANOVA
세 집단 이상, 제대로
비모수 검정
데이터가 정규가 아닐 때