Blog/가설검정 기초

통계

가설검정 기초

p값, t검정, ANOVA

SK

Skari Team

Skari

2026년 7월·10분

가설검정

α = 0.05

검정통계량이 음영 처리된 꼬리에 들어가면 유의미 — 귀무가설을 기각합니다.

임계값

거의 모든 데이터 질문은 사실 같은 질문입니다: 지금 보이는 것이 진짜인가, 아니면 우연히 일어났을 수 있는가? 전환율이 올랐고, 한 집단이 더 높았고, 지표가 움직였지만 — 표본은 스스로도 흔들립니다. 가설검정은 진짜 효과를 평범한 잡음에서 갈라내는 절제된 방법입니다.

Note

가설검정은 효과가 진짜임을 결코 증명하지 않습니다. 효과가 없다면 데이터가 얼마나 놀라울지를 측정하고 — 그 놀라움이 임계값을 넘을 때 행동하게 합니다.

귀무가설과 대립가설

모든 검정은 서로 경쟁하는 두 진술로 시작합니다. 귀무가설은 지루한 기본값입니다: 아무 일도 없다 — 집단이 같다, 변화가 아무것도 안 했다. 대립가설은 당신이 의심하는 것입니다: 차이가 있다.

가설말하는 것
귀무(H₀)효과 없음 — 어떤 차이든 우연
대립(H₁)진짜 효과 존재

논리는 의도적으로 보수적입니다: 귀무가설이 참이라 가정하고 데이터가 그것을 믿기엔 너무 놀라운지 묻습니다. 귀무가설을 "받아들이는" 일은 결코 없습니다 — 기각하거나 기각하지 못할 뿐입니다.

p값이 실제로 뜻하는 것

p값은 귀무가설이 참이라면 당신 것만큼, 또는 그보다 극단적인 데이터를 볼 확률입니다. 작은 p값은 당신 결과가 "효과 없음" 하에서 가능성이 낮다는 뜻이니, 효과 없음 이야기가 그럴듯해 보이지 않기 시작합니다.

p값해석
p < 0.05흔한 관례상 통계적으로 유의
p ≈ 0.05경계 — 신중히 다룸
p > 0.05귀무가설을 기각할 증거 부족

Watch out

p값은 귀무가설이 참일 확률도, 당신 결과가 우연이었을 확률도 아닙니다. 효과가 없다고 가정할 때 이만큼 극단적인 데이터가 나올 확률입니다. 이 구별이 대부분의 오용이 시작되는 지점입니다.

유의성은 크기가 아니다

표본이 충분히 크면 사소하고 무의미한 차이도 "유의"할 수 있고, 작은 연구에서는 크고 중요한 차이도 유의성을 놓칠 수 있습니다. p값 하나가 결코 전체 답이 아닌 이유입니다.

  • 효과크기: 차이가 실제 단위로 얼마나 큰가
  • 신뢰구간: 참 효과의 그럴듯한 범위
  • 표본 크기: 큰 표본은 사소한 효과도 유의하게 만듦

Tip

유의성 효과크기를 항상 함께 보고하세요. "유의함"은 '진짜인가?'에 답하고, 효과크기는 '중요한가?'에 답합니다 — 사업을 굴리는 것은 두 번째뿐입니다.

검정 고르기

상황검정
두 집단 평균t검정
세 집단 이상 평균ANOVA
두 범주형 변수카이제곱
치우친 데이터 / 작은 표본비모수(Mann-Whitney, Kruskal-Wallis)

각 검정은 가정 — 정규성, 등분산, 독립성 — 도 지닙니다. 어기면 p값을 믿을 수 없으니, 가정 확인은 나중 일이 아니라 검정의 일부입니다.

틀리는 두 가지 방식

오류의미
1종(거짓 양성)참인 귀무를 기각 — 없는 효과를 봄
2종(거짓 음성)있는 진짜 효과를 놓침

Watch out

하나가 "유의"할 때까지 검정을 여러 번 돌리면(p-해킹) 1종 오류를 제조합니다. 추가 검정마다 또 한 번 주사위를 던지는 셈 — 보고 나서가 아니라 보기 전에 검정을 정하세요.

SKARI Statistical Lab의 가설검정

SKARI의 Statistical Lab은 알맞은 검정을 실행하고 가정을 지킵니다: 변수를 고르면 선택·점검·해석하니 — 유의성, 효과크기, 쉬운 말 해석을 함께 얻습니다.

  • 일표본·독립·대응 t검정, 일원·이원 ANOVA
  • 범주형 관계를 위한 교차표와 카이제곱
  • 자동 정규성·분산 점검, 실패 시 비모수 대안(Mann-Whitney, Kruskal-Wallis)
  • p값과 함께 제공되는 효과크기와 해석

Takeaway

가정이 대신 점검되고 효과크기가 p값 옆에 놓입니다 — 그래서 과신할 외로운 숫자가 아니라 '진짜인가, 중요한가?'를 읽습니다.

자주 묻는 질문

p < 0.05는 법칙인가요?

아니요 — 관례입니다. 올바른 임계값은 거짓 양성의 비용에 달렸고, 일부 분야는 0.01이나 더 엄격한 값을 씁니다.

큰 p값이 효과 없음을 증명하나요?

아니요 — 효과에 대한 증거가 부족하다는 뜻입니다. 증거의 부재가 부재의 증거는 아닙니다, 특히 작은 표본에서.

가장 중요한 습관 하나는?

데이터를 보기 전에 가설과 검정을 정하고, p값 옆에 효과크기를 항상 보고하는 것입니다.

핵심 요약

가정

H₀

효과 없음

측정

p값

H₀ 하 놀라움

함께 필요

효과

중요한가?

임계값

0.05

관례

가설검정은 잡음을 신호로 착각하지 않게 합니다. 아무 일도 없다고 가정하고, 데이터가 얼마나 놀라울지 측정하고, 무언가를 성과라 부르기 전에 유의성을 효과크기와 짝지으세요.

Takeaway

'아무 일도 없다면 이게 얼마나 놀라울까?'를 묻고 — 그 답을 효과 크기와 나란히 읽으세요, 결코 홀로가 아니라.

t검정

두 평균 비교

신뢰구간

추정치 뒤의 범위

ANOVA

세 집단 이상 한 번에