거의 모든 데이터 질문은 사실 같은 질문입니다: 지금 보이는 것이 진짜인가, 아니면 우연히 일어났을 수 있는가? 전환율이 올랐고, 한 집단이 더 높았고, 지표가 움직였지만 — 표본은 스스로도 흔들립니다. 가설검정은 진짜 효과를 평범한 잡음에서 갈라내는 절제된 방법입니다.
Note
귀무가설과 대립가설
모든 검정은 서로 경쟁하는 두 진술로 시작합니다. 귀무가설은 지루한 기본값입니다: 아무 일도 없다 — 집단이 같다, 변화가 아무것도 안 했다. 대립가설은 당신이 의심하는 것입니다: 차이가 있다.
| 가설 | 말하는 것 |
|---|---|
| 귀무(H₀) | 효과 없음 — 어떤 차이든 우연 |
| 대립(H₁) | 진짜 효과 존재 |
논리는 의도적으로 보수적입니다: 귀무가설이 참이라 가정하고 데이터가 그것을 믿기엔 너무 놀라운지 묻습니다. 귀무가설을 "받아들이는" 일은 결코 없습니다 — 기각하거나 기각하지 못할 뿐입니다.
p값이 실제로 뜻하는 것
p값은 귀무가설이 참이라면 당신 것만큼, 또는 그보다 극단적인 데이터를 볼 확률입니다. 작은 p값은 당신 결과가 "효과 없음" 하에서 가능성이 낮다는 뜻이니, 효과 없음 이야기가 그럴듯해 보이지 않기 시작합니다.
| p값 | 해석 |
|---|---|
| p < 0.05 | 흔한 관례상 통계적으로 유의 |
| p ≈ 0.05 | 경계 — 신중히 다룸 |
| p > 0.05 | 귀무가설을 기각할 증거 부족 |
Watch out
유의성은 크기가 아니다
표본이 충분히 크면 사소하고 무의미한 차이도 "유의"할 수 있고, 작은 연구에서는 크고 중요한 차이도 유의성을 놓칠 수 있습니다. p값 하나가 결코 전체 답이 아닌 이유입니다.
- 효과크기: 차이가 실제 단위로 얼마나 큰가
- 신뢰구간: 참 효과의 그럴듯한 범위
- 표본 크기: 큰 표본은 사소한 효과도 유의하게 만듦
Tip
검정 고르기
| 상황 | 검정 |
|---|---|
| 두 집단 평균 | t검정 |
| 세 집단 이상 평균 | ANOVA |
| 두 범주형 변수 | 카이제곱 |
| 치우친 데이터 / 작은 표본 | 비모수(Mann-Whitney, Kruskal-Wallis) |
각 검정은 가정 — 정규성, 등분산, 독립성 — 도 지닙니다. 어기면 p값을 믿을 수 없으니, 가정 확인은 나중 일이 아니라 검정의 일부입니다.
틀리는 두 가지 방식
| 오류 | 의미 |
|---|---|
| 1종(거짓 양성) | 참인 귀무를 기각 — 없는 효과를 봄 |
| 2종(거짓 음성) | 있는 진짜 효과를 놓침 |
Watch out
SKARI Statistical Lab의 가설검정
SKARI의 Statistical Lab은 알맞은 검정을 실행하고 가정을 지킵니다: 변수를 고르면 선택·점검·해석하니 — 유의성, 효과크기, 쉬운 말 해석을 함께 얻습니다.
- 일표본·독립·대응 t검정, 일원·이원 ANOVA
- 범주형 관계를 위한 교차표와 카이제곱
- 자동 정규성·분산 점검, 실패 시 비모수 대안(Mann-Whitney, Kruskal-Wallis)
- p값과 함께 제공되는 효과크기와 해석
Takeaway
자주 묻는 질문
p < 0.05는 법칙인가요?
아니요 — 관례입니다. 올바른 임계값은 거짓 양성의 비용에 달렸고, 일부 분야는 0.01이나 더 엄격한 값을 씁니다.
큰 p값이 효과 없음을 증명하나요?
아니요 — 효과에 대한 증거가 부족하다는 뜻입니다. 증거의 부재가 부재의 증거는 아닙니다, 특히 작은 표본에서.
가장 중요한 습관 하나는?
데이터를 보기 전에 가설과 검정을 정하고, p값 옆에 효과크기를 항상 보고하는 것입니다.
핵심 요약
가정
H₀
효과 없음
측정
p값
H₀ 하 놀라움
함께 필요
효과
중요한가?
임계값
0.05
관례
가설검정은 잡음을 신호로 착각하지 않게 합니다. 아무 일도 없다고 가정하고, 데이터가 얼마나 놀라울지 측정하고, 무언가를 성과라 부르기 전에 유의성을 효과크기와 짝지으세요.
Takeaway
t검정
두 평균 비교
신뢰구간
추정치 뒤의 범위
ANOVA
세 집단 이상 한 번에