Blog/집단 비교

통계

집단 비교

올바른 검정 고르고 실행하기

SK

Skari Team

Skari

2026년 7월·15분

분산분석

ANOVA는 세 개 이상의 집단 평균을 한 번에 비교하며 거짓 양성률을 통제합니다.

ABCD

거의 모든 실험은 같은 질문으로 끝납니다: 이 집단들이 정말 다른가, 아니면 숫자가 그렇게 나온 것뿐인가? 버전 B의 전환이 조금 나았고, 요금제 C의 사용자가 조금 더 쓰고, 새 프로세스가 몇 초를 줄였습니다. 각각이 집단 비교이며 — 이 방법 family 전체가 진짜 차이를 운 좋은 표본에서 갈라내려고 존재합니다.

함정은 "집단을 비교하라"가 하나의 검정이 아니라는 점입니다. 그것은 의사결정 나무입니다. 두 집단인가 여럿인가? 독립인가 대응인가? 정규인가 치우쳤는가? 각 가지가 다른 방법으로 이어지고, 잘못된 가지를 고르면 권위 있어 보이지만 아무 의미 없는 p값이 나옵니다. 이 가이드는 그 나무 전체를 걷습니다.

Note

비교는 대부분의 통계 작업에서 가장 큰 분석 family입니다. 선택 — 집단 수, 대응 여부, 분포 — 만 맞으면 실제 검정은 쉬운 부분입니다.

검정을 정하는 세 질문

어떤 검정을 돌리기 전에, 세 질문이 무엇이 유효한지 결정합니다. 순서대로 답하면 선택이 저절로 됩니다.

  1. 1집단이 몇 개인가? 둘이면 t검정, 셋 이상이면 ANOVA로 향합니다.
  2. 2집단이 독립인가 대응인가? 같은 사람의 전후는 대응, 별개 코호트는 독립입니다.
  3. 3데이터가 대략 정규인가, 이상치로 치우쳤는가? 정규면 고전적 모수 검정, 치우쳤으면 비모수 대안으로 향합니다.

Tip

어떤 p값을 보기 전에 이 셋을 먼저 답하세요. 비교에서 가장 흔한 실수는 계산이 아니라 — 데이터가 결코 충족하지 못한 가정의 검정을 돌리는 것입니다.

두 집단: t검정

정확히 두 집단이면 t검정이 평균 간 격차를 각 집단 내 퍼짐과 저울질합니다. 지저분한 두 집단 사이의 큰 차이는 아무것도 아닐 수 있고, 촘촘한 두 집단 사이의 작은 차이는 진짜일 수 있습니다.

유형비교 대상
일표본한 집단의 평균을 알려진 값과
독립(이표본)서로 다른 두 집단의 평균
대응같은 대상의 전 vs 후

두 측정이 같은 사람·항목에서 나올 땐 언제나 대응 검정을 쓰세요 — 개인 간 변동을 제거해 훨씬 강력합니다. 분산이 다르면 Welch 보정이 안전한 기본값입니다. 전용 t검정 가이드가 가정과 결과 읽기를 깊이 다룹니다.

세 집단 이상: ANOVA

여러 집단일 때의 본능은 모든 쌍에 t검정을 돌리는 것입니다. 그러지 마세요 — 각 검정엔 거짓 양성 위험이 있고 여섯 번의 비교가 그걸 쌓습니다. ANOVA(분산분석)는 집단 평균 사이의 변동을 집단 변동과 비교해 모든 집단을 한 번에 검정합니다.

설계언제
일원 ANOVA요인 하나(예: 요금제 등급)
이원 ANOVA요인 둘과 그 상호작용
반복측정같은 대상을 조건에 걸쳐

Watch out

유의한 ANOVA는 적어도 한 집단이 다르다고 할 뿐 어느 것인지는 아닙니다. 오류율을 통제하며 구체적 쌍을 찾는 사후검정(Tukey HSD 등)을 항상 뒤따르세요. ANOVA 가이드가 이를 처음부터 끝까지 다룹니다.

데이터가 정규가 아닐 때: 비모수 검정

t검정과 ANOVA는 대략 정규인 데이터를 가정합니다. 심하게 치우쳤거나, 강한 이상치가 있거나, 평점 척도이거나, 표본이 아주 작으면 평균은 공정한 요약이 못 됩니다. 순위 기반 검정은 값의 순서를 대신 비교하며, 평균이 못 할 때에도 정직합니다.

모수 검정비모수 대응
독립 t검정Mann-Whitney U
대응 t검정Wilcoxon 부호순위
일원 ANOVAKruskal-Wallis

각각 평균 기반 비교를 순위 기반으로 바꿔 정규성 가정 없이 같은 질문에 답합니다. 정직한 대안이지만 — 데이터가 정말 정규면 모수 검정이 더 강력하니, 기본값으로 순위를 집지 마세요. 절충은 비모수 검정 가이드를 보세요.

유의성은 크기가 아니다

모든 비교는 p값을 반환하지만, p값은 '차이가 진짜인가?'에만 답합니다. '중요한가?'는 아무것도 말하지 않습니다. 표본이 충분히 크면 신경 쓸 필요 없이 작은 차이도 "유의"해집니다.

  • 효과크기(Cohen's d, 에타제곱)는 차이가 실제로 얼마나 큰지 보고
  • 신뢰구간은 참 격차의 그럴듯한 범위를 제공
  • p값 옆에 둘 다 보고 — 크기 없는 유의성은 반쪽 답

Tip

사소한 효과에 작은 p값은 결과를 과장하는 흔한 방법입니다. 사업을 굴리는 숫자는 p값이 아니라 효과크기입니다.

다중비교 함정

모든 검정엔 거짓 양성 가능성이 있습니다. 0.05 임계로 스무 번 비교하면 평균적으로 하나의 "유의한" 결과가 순전한 우연으로 나타납니다. 많은 쌍을 검정하고, 반복해 엿보고, 하나가 걸릴 때까지 변수를 시도하는 것이 잡음을 신호로 발표하는 방식입니다.

Watch out

데이터를 보기 전에 비교를 정하세요. 여러 번 돌릴 때는 전체 오류율이 통제되도록 보정(본페로니, Tukey, 거짓발견율 제어)을 쓰세요.

의사결정 표

상황정규 데이터치우침 / 작은 n
독립 2집단독립 t검정Mann-Whitney U
대응 2측정대응 t검정Wilcoxon 부호순위
독립 3집단 이상일원 ANOVA + 사후Kruskal-Wallis
요인 둘 동시이원 ANOVA(순위 기반 / 강건)

이 표가 family 전체의 축소판입니다: 당신의 행으로 내려가 분포로 가로질러, 둘이 만나는 칸이 유효한 검정입니다.

SKARI Statistical Lab의 집단 비교

SKARI의 Statistical Lab은 비교를 — 전체 검정을 갖춘 가장 큰 — 독립된 family로 다루며, 선택과 가정 점검을 대신 해줍니다.

  • Welch 보정이 있는 일표본·독립·대응 t검정
  • 사후비교가 있는 일원·이원·반복측정 ANOVA
  • 정규성이 실패할 때 제공되는 비모수 검정 — Mann-Whitney, Wilcoxon, Kruskal-Wallis
  • p값이 아니라 확률을 원할 때의 베이지안 비교 방법
  • 자동 정규성·분산 점검, 효과크기, 쉬운 말 해석

Takeaway

집단만 고르면 SKARI가 가정을 점검하고 유효한 검정을 골라 유의성을 효과크기와 함께 돌려줍니다 — 그래서 비교가 데이터가 실제로 뒷받침하는 검정 위에 섭니다.

자주 묻는 질문

그냥 모든 쌍에 t검정을 돌리면 안 되나요?

안 됩니다 — 셋 이상이면 거짓 양성을 부풀립니다. 전체 오류율을 통제하는 사후검정과 함께 ANOVA를 쓰세요.

대응과 독립 중?

두 측정이 같은 대상(전/후)이면 대응, 집단이 별개 코호트면 독립입니다.

데이터가 충분히 정규인지 어떻게 아나요?

히스토그램이나 정규성 검정을 확인하세요. SKARI가 자동으로 점검하고 실패 시 비모수 검정으로 안내합니다.

차이의 크기만 중요하면?

효과크기와 그 신뢰구간을 보고하세요. 유의성은 진짜임을, 효과크기는 행동할 가치가 있는지를 알려줍니다.

핵심 요약

2집단

t검정

대응 여부

3집단+

ANOVA

이후 사후

치우침

순위

비모수

항상

효과

p 옆에

집단 비교는 계산보다 선택의 문제입니다. 집단을 세고, 대응 여부를 확인하고, 분포를 보면 올바른 검정이 따라옵니다 — 그런 다음 유의성을 효과크기와 함께 읽고, 여러 번 돌리면 보정하세요. 그러면 '이 집단들은 다르다'가 방어할 수 있는 주장이 됩니다.

Takeaway

검정은 쉽고, 선택이 전부입니다. '몇 개, 대응, 정규?'를 먼저 답하면 비교는 저절로 됩니다.

t검정

두 집단 경우를 깊이

ANOVA

세 집단 이상, 제대로

비모수 검정

데이터가 정규가 아닐 때