현재 본문을 보고 있습니다
배우기
인터랙티브·

카이제곱 검정

범주별 관측빈도가 우연히 기대되는 빈도와 다른지 확인합니다.

1

들어가며

성별에 따라 선택한 상품이 다르다고 말해도 될까?

남성 100명 중 60명이 A를, 여성 100명 중 30명이 A를 선택했습니다. 표본에서는 분명한 차이가 보이지만 다른 200명을 조사해도 비슷할지는 아직 알 수 없습니다.

성별과 상품 선택의 관측빈도

A 상품
B 상품
남성
60
40
여성
30
70

성별에 따라 A와 B의 선택 비율이 달라 보입니다.

카이제곱 검정은 두 범주형 변수에 관계가 없다고 가정했을 때 기대되는 빈도와 실제 관측빈도를 비교합니다.

핵심 질문

관측된 빈도 차이는 독립이라는 가정에서 우연히 생길 만한 크기일까요?

관측도수

O

실제 교차표 각 셀에서 관측된 빈도를 확인합니다.

기대도수

E

두 범주가 독립일 때 예상되는 셀 빈도를 계산합니다.

차이의 합

χ²

관측과 기대의 차이를 셀별로 표준화해 합칩니다.

1

개념

관측빈도와 기대빈도의 비교부터

2

무엇을 알아보는 분석인가

범주형 자료의 빈도와 비율을 검정합니다

검정질문예시
독립성 검정두 범주형 변수가 관련되는가?성별과 상품 선택
동질성 검정여러 모집단의 범주 비율이 같은가?지역별 정당 지지율
적합도 검정한 변수의 분포가 기대 비율과 같은가?주사위 여섯 면이 균등한가?

평균이 아니라 빈도입니다

카이제곱 검정은 점수의 평균을 비교하지 않습니다. 각 사람이 어느 범주에 들어갔는지를 세어 만든 빈도를 분석합니다.

3

기대빈도란 무엇인가

두 변수가 독립이라면 각 셀에 몇 명이 있어야 하는지 계산합니다

관측빈도 O

AB
남성6040
여성3070

독립일 때 기대빈도 E

AB
남성4555
여성4555
Eij=(행 합계i)(열 합계j)전체 합계E_{ij}=\frac{(\text{행 합계}_i)(\text{열 합계}_j)}{\text{전체 합계}}
교차표 셀의 기대빈도

기대빈도는 원하는 결과나 과거 평균이 아니라, 현재 표의 행·열 합계를 유지하면서 두 변수가 독립일 때 계산되는 빈도입니다.

4

핵심 원리

관측빈도와 기대빈도의 차이를 셀마다 표준화해 더합니다

χ2=i,j(OijEij)2Eij\chi^2=\sum_{i,j}\frac{(O_{ij}-E_{ij})^2}{E_{ij}}
관측빈도와 기대빈도의 차이를 셀마다 표준화해 합한 카이제곱 통계량
요소역할
O−E각 셀이 독립 가정에서 벗어난 방향과 크기
제곱양수·음수 차이가 서로 상쇄되지 않게 함
E로 나눔기대 규모가 다른 셀을 비교 가능하게 함
합계표 전체의 불일치를 하나의 χ²로 요약

χ²는 0 이상이며 클수록 관측표가 독립 가정에서 더 멀리 떨어져 있습니다.

2

왜 중요한가

비율 차이만으로 결론 내릴 수 없는 이유

5

어떤 검정을 선택하는가

표의 목적과 표본의 독립성을 먼저 확인합니다

상황선택
독립된 사람들의 2×2 이상 교차표Pearson 카이제곱
2×2 표에서 기대빈도가 매우 작음Fisher 정확검정
같은 사람의 전후 이분형 결과McNemar 검정
순서형 범주의 선형 추세추세 검정 또는 순서형 모형

행과 열의 이름이 무엇인지보다 같은 사람이 한 셀에 한 번만 들어가는지, 대응자료인지가 검정 선택을 결정합니다.

6

분석은 어떻게 이루어지는가

교차표 구성부터 효과크기까지

단계하는 일
1두 범주형 변수와 분석 대상 표본을 정합니다.
2관측빈도로 교차표를 만듭니다.
3행·열 합계로 기대빈도를 계산합니다.
4작은 기대빈도와 독립성 조건을 확인합니다.
5셀별 (O−E)²/E를 합해 χ²를 계산합니다.
6자유도 (행−1)(열−1)로 p값을 구합니다.
7표준화 잔차와 Cramér’s V로 위치와 크기를 해석합니다.
7

결과는 어떻게 읽는가

전체 관계, 관계가 나타난 셀, 효과크기를 차례로 봅니다

결과읽는 질문
행·열 비율어떤 범주의 비율이 실제로 다른가?
χ²와 p값독립 가정과 충분히 충돌하는가?
표준화 잔차어느 셀이 기대보다 많거나 적은가?
Cramér’s V표본 크기를 제외한 연관성의 크기는 어느 정도인가?

유의한 χ²는 방향을 알려주지 않습니다

전체 표에 관계가 있다는 뜻입니다. 구체적인 패턴은 비율과 잔차를 확인해야 합니다.

3

작동 원리

셀별 차이가 χ²로 합쳐지는 과정

8

대표 사례

성별과 상품 선택의 관계를 분석합니다

관측표

남성: A 60명, B 40명 · 여성: A 30명, B 70명 · 전체 200명

결과
기대빈도남·A 45, 남·B 55, 여·A 45, 여·B 55
χ²18.18
자유도1
p값< .001
Cramér’s V.302

결과 해석

성별과 상품 선택은 유의하게 관련되었습니다(χ²(1)=18.18, p<.001, V=.302). 남성의 A 선택은 기대보다 많고 여성의 A 선택은 기대보다 적었습니다. 이는 관계의 존재를 보여주지만 성별이 선택을 원인으로 만들었다는 뜻은 아닙니다.

9

가정과 주의점

빈도와 표본 구조를 먼저 확인합니다

확인할 것문제가 생기면
관측값의 독립성반복응답·가족·학급 군집이면 일반 χ²의 표준오차가 맞지 않습니다.
원자료가 빈도인지백분율만 넣으면 실제 표본 크기 정보가 사라집니다.
기대빈도작은 셀이 많으면 χ² 근사가 부정확해집니다.
범주 중복한 사람이 여러 범주에 동시에 들어가면 단순 교차표가 아닙니다.
표본 크기매우 큰 표본은 미미한 관계도 유의하게 만들 수 있습니다.
10

흔한 오해

카이제곱 결과를 잘못 읽는 대표적인 경우

오해 1 · 유의하면 두 변수가 강하게 관련된다

강도는 Cramér’s V와 비율 차이로 판단합니다.

오해 2 · 기대빈도는 각 셀이 같다는 뜻이다

행·열 합계가 다르면 독립일 때의 기대빈도도 셀마다 다릅니다.

오해 3 · χ²가 크면 인과관계다

연관성만 검정하며 교란과 역인과를 제거하지 않습니다.

오해 4 · 백분율을 빈도처럼 넣어도 된다

검정은 실제 개수와 표본 크기를 필요로 합니다.

4

예시

성별과 상품 선택 자료를 처음부터 끝까지

11

직접 해보기

관측표가 독립에서 멀어질수록 χ²가 어떻게 변하는지 관찰합니다

행·열 합계를 유지한 채 대각선 셀의 빈도를 이동해보세요. 기대빈도와의 차이가 커질수록 χ²가 증가합니다.

남·A

45

남·B

55

여·A

45

여·B

55
χ2=(OE)2E\chi^2=\sum\frac{(O-E)^2}{E}

0.00

독립 가정과 크게 충돌하지 않음

카이제곱 검정 인터랙티브 랩

효과와 불확실성을 바꾸며 두 분포의 겹침, 검정통계량과 판단 경계가 함께 움직이는지 보세요.

관측도수기대도수셀 색 차이가 커질수록 χ² 증가

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

현재 조건

1.0 · 1.1

조절값과 그래프의 변화를 함께 확인하세요.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

관찰할 것

  • 관측빈도와 기대빈도가 같을 때 χ²가 0인지 확인합니다.
  • 셀의 차이가 커질수록 제곱항 때문에 χ²가 빠르게 증가하는지 봅니다.
  • 표 전체의 합계가 같아도 배치에 따라 결과가 달라지는지 확인합니다.
  • 유의성 외에 비율 차이와 효과크기가 필요한 이유를 생각합니다.
5

직접 해보기

관측빈도를 바꿔보기

12

핵심 정리

카이제곱 검정에서 기억해야 할 판단 규칙

핵심 정리

  • 카이제곱 검정은 범주형 자료의 관측빈도와 기대빈도를 비교한다.
  • 기대빈도는 독립 가정과 현재 행·열 합계로 계산한다.
  • χ²는 셀별 불일치를 표 전체로 합한 값이다.
  • 유의한 결과는 관계의 존재만 알려주며 위치는 잔차로 확인한다.
  • 관계의 크기는 Cramér’s V와 비율 차이로 판단한다.
  • 독립성·기대빈도·실제 빈도 입력을 반드시 확인한다.
13

더 깊이 알아보기

표의 구조에 따라 확장 방법이 달라집니다

주제핵심 내용
Fisher 정확검정작은 2×2 표에서 정확한 확률을 계산합니다.
표준화 잔차각 셀이 전체 χ²에 기여한 방향과 크기를 보여줍니다.
오즈비2×2 표에서 연관성의 방향과 배수를 나타냅니다.
로그선형 모형여러 범주형 변수의 고차원 교차표를 분석합니다.
로지스틱 회귀이분형 결과에 여러 예측변수와 교란변수를 함께 반영합니다.

다음 연결

카이제곱은 범주형 자료의 비모수적 분석 중 하나입니다. 순서나 중앙 위치를 비교하는 자료에는 다른 비모수 검정이 필요합니다.

다음: 분산분석(ANOVA)