현재 본문을 보고 있습니다
배우기
인터랙티브·

검정 가정: 정규성·등분산성

검정이 믿을 만한지 확인하되, p값 하나로 사용 가능 여부를 결정하지 않습니다.

1

들어가며

정규성 검정 p=.03이면 t검정을 쓰면 안 될까?

표본이 200명인 자료에서 정규성 검정 p=.03이 나왔다고 해봅시다. 분포는 거의 대칭이지만 작은 일탈을 큰 표본이 탐지했을 수 있습니다. 반대로 표본 8명에서는 심한 비대칭도 검정력이 부족해 p=.20이 나올 수 있습니다.

대칭·이상치 없음

오른쪽 비대칭

극단값 포함

가정 검정의 p값은 판단 재료 중 하나일 뿐입니다. 어떤 가정이 필요한지, 얼마나 위반되었는지, 검정이 그 위반에 얼마나 강건한지를 함께 봐야 합니다.

핵심 질문

현재 자료의 가정 위반이 실제 p값과 신뢰구간을 왜곡할 만큼 심각할까요?

정규성

분포 모양

잔차 또는 집단별 분포가 추론에 충분히 적합한지 봅니다.

등분산성

같은 폭

집단이나 예측값 수준에 따라 잔차의 폭이 달라지는지 확인합니다.

대안 선택

강건 분석

위반의 크기와 표본 구조에 따라 Welch·강건 SE·비모수를 선택합니다.

1

개념

무엇이 정규적이고 무엇의 분산이 같아야 하는가

2

정규성은 무엇의 정규성인가

대개 원자료 전체가 아니라 오차나 집단별 분포에 관한 가정입니다

분석정규성 가정의 대상
단일표본 t검정관측값 또는 평균 주변 오차
독립표본 t검정·ANOVA각 집단 안의 오차
대응표본 t검정전후 각각이 아니라 짝별 차이
선형회귀예측변수가 아니라 잔차
큰 표본의 평균 검정중심극한정리로 평균의 분포가 근사 정규

예측변수가 정규일 필요는 없습니다

회귀에서 나이·소득 같은 X가 정규분포일 필요는 없습니다. 정규성은 주로 작은 표본에서 계수 검정에 사용하는 잔차분포와 관련됩니다.

3

등분산성은 무엇인가

비교 집단 또는 조건에 따라 오차의 산포가 일정하다는 가정입니다

등분산에 가까움

집단별 산포가 비슷함

이분산

집단별 산포가 크게 다름

분석등분산성의 의미위반 시 대안
독립표본 t검정두 집단의 모집단 분산이 같음Welch t검정
일원 ANOVA모든 집단의 오차분산이 같음Welch ANOVA
회귀예측값 수준에 따라 잔차분산이 일정이분산 강건 표준오차
대응표본 t검정두 시점 분산이 같을 필요 없음짝별 차이의 분포를 확인
4

독립성은 더 중요한 가정

정규성보다 설계에서 먼저 확인합니다

같은 학생의 반복 측정, 같은 학급 학생, 같은 환자의 여러 기록은 서로 독립이 아닙니다. 이를 독립 관측처럼 분석하면 실제 정보량을 과대평가해 표준오차가 지나치게 작아질 수 있습니다.

자료 구조적절한 접근
같은 대상의 전후대응검정·반복측정 모형
학생이 학급에 속함다층모형·군집강건 SE
개인의 반복 방문혼합모형·GEE
시계열 관측자기상관을 반영한 모형

독립성은 사후 검정으로 고치기 어렵습니다

자료가 어떻게 수집되었는지를 알아야 판단할 수 있습니다. 설계를 무시한 분석은 정규성 변환만으로 해결되지 않습니다.

2

왜 중요한가

가정 위반의 종류와 심각도가 중요한 이유

5

가정은 어떻게 확인하는가

그래프를 먼저 보고 검정은 보조적으로 사용합니다

도구무엇을 보는가한계
히스토그램·밀도비대칭·다봉성·꼬리작은 표본에서 모양이 불안정
Q–Q plot정규분포 분위수와의 일탈해석에 경험이 필요
상자그림집단별 산포와 이상치분포의 세부 모양은 제한적
잔차 대 적합값부채꼴 이분산·비선형성모형을 먼저 적합해야 함
Shapiro·Levene정규성·등분산성의 형식 검정표본 크기에 매우 민감
6

표본 크기가 판단을 바꾼다

작은 표본과 큰 표본에서 진단검정의 문제가 반대입니다

표본진단검정실제 판단
작은 표본심한 위반도 검출하지 못할 수 있음그래프·연구 맥락·강건 대안 중시
큰 표본사소한 일탈도 유의할 수 있음위반의 크기와 분석의 강건성 중시
불균형 집단분산 위반과 결합하면 왜곡 증가Welch·강건 SE 우선 고려

중요한 것은 ‘완벽한 정규성’이 아니라 관심 통계량의 표본분포와 표준오차가 충분히 정확한가입니다.

7

가정 위반 시 무엇을 하는가

문제의 원인에 맞는 대안을 선택합니다

문제가능한 대응
분산 차이Welch t·Welch ANOVA·강건 표준오차
오른쪽 비대칭로그 변환·GLM·부트스트랩·비모수 검정
극단값입력 오류 확인·민감도 분석·강건 통계
반복·군집대응·혼합모형·GEE·군집강건 SE
순서형·천장효과순위검정·순서형 회귀

이상치를 자동 삭제하지 않습니다

오류인지 실제 관측인지 확인하고, 포함·제외 결과를 비교하며, 제외 기준을 투명하게 보고해야 합니다.

3

작동 원리

그래프·진단·강건 대안을 선택하는 과정

8

진단은 어떻게 이루어지는가

설계 확인에서 민감도 분석까지

단계하는 일
1독립·대응·군집 등 수집 구조를 확인합니다.
2집단별 원자료와 결측·입력 오류를 확인합니다.
3히스토그램·Q–Q plot·상자그림을 봅니다.
4잔차와 집단별 산포를 확인합니다.
5형식 검정은 표본 크기와 함께 보조적으로 읽습니다.
6위반이 추론에 미칠 영향을 판단합니다.
7Welch·강건 SE·변환·비모수 등 대안을 선택합니다.
8가능하면 원 분석과 대안의 민감도 결과를 비교합니다.
9

대표 사례

두 수업 집단의 시험 점수를 진단합니다

자료 상황

A반 n=20, 평균 72, SD 6 · B반 n=35, 평균 80, SD 15. B반에는 높은 점수 쪽 꼬리가 있고 두 집단의 분산도 크게 다릅니다.

진단결과판단
독립성서로 다른 학생충족
Q–Q plotB반 상단 꼬리 일탈주의
Levene 검정p=.008등분산성에 반하는 근거
표본 불균형20명 vs 35명분산 차이와 결합해 합동 t 부적절
선택Welch t검정분산 동일성을 요구하지 않음

결과 해석

두 집단의 분산과 표본 크기가 달라 합동분산 t검정 대신 Welch t검정을 사용합니다. 원자료 그래프와 이상치 민감도 분석도 함께 제시합니다. Levene p값만으로 분석을 중단하는 것이 아니라 위반에 맞게 표준오차와 자유도를 조정합니다.

10

흔한 오해

검정 가정을 잘못 다루는 대표적인 경우

오해 1 · 정규성 p<.05면 모수 검정을 못 쓴다

표본 크기, 위반 정도, 이상치, 검정의 강건성을 함께 봐야 합니다.

오해 2 · p>.05면 정규성이 증명된다

특히 작은 표본에서는 위반을 탐지할 검정력이 부족할 수 있습니다.

오해 3 · 모든 변수는 정규분포여야 한다

분석에 따라 집단 내 오차, 짝별 차이, 회귀 잔차가 대상입니다.

오해 4 · 등분산이 아니면 비모수로 간다

평균 비교가 목적이면 Welch 검정이 더 직접적이고 강건한 경우가 많습니다.

4

예시

두 집단 점수 자료를 처음부터 끝까지 진단하기

11

직접 해보기

비대칭·분산비·표본 크기가 위험 판단을 어떻게 바꾸는지 관찰합니다

세 조건을 바꿔보세요. 같은 위반도 표본 크기와 집단 균형에 따라 추론에 미치는 영향이 달라집니다.

개념적 위험 신호

대체로 강건한 범위

실제 판단은 원자료·잔차·이상치·표본 불균형을 함께 봅니다.

검정 가정: 정규성·등분산성 인터랙티브 랩

효과와 불확실성을 바꾸며 두 분포의 겹침, 검정통계량과 판단 경계가 함께 움직이는지 보세요.

H₀기각영역

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

현재 조건

1.0 · 1.1

조절값과 그래프의 변화를 함께 확인하세요.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

관찰할 것

  • 표본이 작을 때 비대칭의 위험 신호가 더 커지는지 봅니다.
  • 분산비가 커질수록 특히 불균형 표본에서 문제가 되는 이유를 생각합니다.
  • 큰 표본에서는 평균 검정이 비정규성에 더 강건해지는지 확인합니다.
  • 그래도 독립성 위반은 표본 크기로 해결되지 않는다는 점을 기억합니다.
5

직접 해보기

비대칭·분산비·표본 크기를 바꿔보기

12

핵심 정리

검정 가정에서 기억해야 할 판단 규칙

핵심 정리

  • 정규성은 분석에 따라 집단 내 오차·짝별 차이·잔차에 관한 가정이다.
  • 등분산성은 집단이나 예측 수준에 따라 오차분산이 일정하다는 뜻이다.
  • 독립성은 정규성보다 먼저 연구 설계에서 확인한다.
  • 그래프를 먼저 보고 형식 검정은 표본 크기와 함께 읽는다.
  • p값 하나가 아니라 위반의 크기와 결과 왜곡 가능성을 판단한다.
  • 위반 원인에 맞춰 Welch·강건 SE·변환·비모수·혼합모형을 선택한다.
13

더 깊이 알아보기

가정 진단은 분석 선택의 끝이 아니라 민감도 확인의 시작입니다

주제핵심 내용
강건성가정이 조금 어긋나도 오류율과 추정이 유지되는 성질입니다.
Welch–Satterthwaite분산과 표본 크기가 다를 때 자유도를 근사합니다.
HC 표준오차회귀의 이분산에 강건한 공분산 추정입니다.
부트스트랩복잡한 표본분포와 신뢰구간을 재추출로 근사합니다.
민감도 분석가정·이상치 처리·방법을 바꿔 결론이 유지되는지 확인합니다.

가정의 목적

자료를 탈락시키는 체크리스트가 아니라, 현재 분석의 p값과 신뢰구간을 어디까지 믿을 수 있는지 판단하고 더 적절한 방법을 고르는 것입니다.

통계적 추론 과정으로 돌아가기