범주별 관측빈도가 우연히 기대되는 빈도와 다른지 확인합니다.
성별에 따라 선택한 상품이 다르다고 말해도 될까?
남성 100명 중 60명이 A를, 여성 100명 중 30명이 A를 선택했습니다. 표본에서는 분명한 차이가 보이지만 다른 200명을 조사해도 비슷할지는 아직 알 수 없습니다.
성별과 상품 선택의 관측빈도
성별에 따라 A와 B의 선택 비율이 달라 보입니다.
카이제곱 검정은 두 범주형 변수에 관계가 없다고 가정했을 때 기대되는 빈도와 실제 관측빈도를 비교합니다.
핵심 질문
관측된 빈도 차이는 독립이라는 가정에서 우연히 생길 만한 크기일까요?
실제 교차표 각 셀에서 관측된 빈도를 확인합니다.
두 범주가 독립일 때 예상되는 셀 빈도를 계산합니다.
관측과 기대의 차이를 셀별로 표준화해 합칩니다.
관측빈도와 기대빈도의 비교부터
범주형 자료의 빈도와 비율을 검정합니다
| 검정 | 질문 | 예시 |
|---|---|---|
| 독립성 검정 | 두 범주형 변수가 관련되는가? | 성별과 상품 선택 |
| 동질성 검정 | 여러 모집단의 범주 비율이 같은가? | 지역별 정당 지지율 |
| 적합도 검정 | 한 변수의 분포가 기대 비율과 같은가? | 주사위 여섯 면이 균등한가? |
평균이 아니라 빈도입니다
카이제곱 검정은 점수의 평균을 비교하지 않습니다. 각 사람이 어느 범주에 들어갔는지를 세어 만든 빈도를 분석합니다.
두 변수가 독립이라면 각 셀에 몇 명이 있어야 하는지 계산합니다
관측빈도 O
| A | B | |
|---|---|---|
| 남성 | 60 | 40 |
| 여성 | 30 | 70 |
독립일 때 기대빈도 E
| A | B | |
|---|---|---|
| 남성 | 45 | 55 |
| 여성 | 45 | 55 |
기대빈도는 원하는 결과나 과거 평균이 아니라, 현재 표의 행·열 합계를 유지하면서 두 변수가 독립일 때 계산되는 빈도입니다.
관측빈도와 기대빈도의 차이를 셀마다 표준화해 더합니다
| 요소 | 역할 |
|---|---|
| O−E | 각 셀이 독립 가정에서 벗어난 방향과 크기 |
| 제곱 | 양수·음수 차이가 서로 상쇄되지 않게 함 |
| E로 나눔 | 기대 규모가 다른 셀을 비교 가능하게 함 |
| 합계 | 표 전체의 불일치를 하나의 χ²로 요약 |
χ²는 0 이상이며 클수록 관측표가 독립 가정에서 더 멀리 떨어져 있습니다.
비율 차이만으로 결론 내릴 수 없는 이유
표의 목적과 표본의 독립성을 먼저 확인합니다
| 상황 | 선택 |
|---|---|
| 독립된 사람들의 2×2 이상 교차표 | Pearson 카이제곱 |
| 2×2 표에서 기대빈도가 매우 작음 | Fisher 정확검정 |
| 같은 사람의 전후 이분형 결과 | McNemar 검정 |
| 순서형 범주의 선형 추세 | 추세 검정 또는 순서형 모형 |
행과 열의 이름이 무엇인지보다 같은 사람이 한 셀에 한 번만 들어가는지, 대응자료인지가 검정 선택을 결정합니다.
교차표 구성부터 효과크기까지
| 단계 | 하는 일 |
|---|---|
| 1 | 두 범주형 변수와 분석 대상 표본을 정합니다. |
| 2 | 관측빈도로 교차표를 만듭니다. |
| 3 | 행·열 합계로 기대빈도를 계산합니다. |
| 4 | 작은 기대빈도와 독립성 조건을 확인합니다. |
| 5 | 셀별 (O−E)²/E를 합해 χ²를 계산합니다. |
| 6 | 자유도 (행−1)(열−1)로 p값을 구합니다. |
| 7 | 표준화 잔차와 Cramér’s V로 위치와 크기를 해석합니다. |
전체 관계, 관계가 나타난 셀, 효과크기를 차례로 봅니다
| 결과 | 읽는 질문 |
|---|---|
| 행·열 비율 | 어떤 범주의 비율이 실제로 다른가? |
| χ²와 p값 | 독립 가정과 충분히 충돌하는가? |
| 표준화 잔차 | 어느 셀이 기대보다 많거나 적은가? |
| Cramér’s V | 표본 크기를 제외한 연관성의 크기는 어느 정도인가? |
유의한 χ²는 방향을 알려주지 않습니다
전체 표에 관계가 있다는 뜻입니다. 구체적인 패턴은 비율과 잔차를 확인해야 합니다.
셀별 차이가 χ²로 합쳐지는 과정
성별과 상품 선택의 관계를 분석합니다
관측표
남성: A 60명, B 40명 · 여성: A 30명, B 70명 · 전체 200명
| 결과 | 값 |
|---|---|
| 기대빈도 | 남·A 45, 남·B 55, 여·A 45, 여·B 55 |
| χ² | 18.18 |
| 자유도 | 1 |
| p값 | < .001 |
| Cramér’s V | .302 |
결과 해석
성별과 상품 선택은 유의하게 관련되었습니다(χ²(1)=18.18, p<.001, V=.302). 남성의 A 선택은 기대보다 많고 여성의 A 선택은 기대보다 적었습니다. 이는 관계의 존재를 보여주지만 성별이 선택을 원인으로 만들었다는 뜻은 아닙니다.
빈도와 표본 구조를 먼저 확인합니다
| 확인할 것 | 문제가 생기면 |
|---|---|
| 관측값의 독립성 | 반복응답·가족·학급 군집이면 일반 χ²의 표준오차가 맞지 않습니다. |
| 원자료가 빈도인지 | 백분율만 넣으면 실제 표본 크기 정보가 사라집니다. |
| 기대빈도 | 작은 셀이 많으면 χ² 근사가 부정확해집니다. |
| 범주 중복 | 한 사람이 여러 범주에 동시에 들어가면 단순 교차표가 아닙니다. |
| 표본 크기 | 매우 큰 표본은 미미한 관계도 유의하게 만들 수 있습니다. |
카이제곱 결과를 잘못 읽는 대표적인 경우
오해 1 · 유의하면 두 변수가 강하게 관련된다
강도는 Cramér’s V와 비율 차이로 판단합니다.
오해 2 · 기대빈도는 각 셀이 같다는 뜻이다
행·열 합계가 다르면 독립일 때의 기대빈도도 셀마다 다릅니다.
오해 3 · χ²가 크면 인과관계다
연관성만 검정하며 교란과 역인과를 제거하지 않습니다.
오해 4 · 백분율을 빈도처럼 넣어도 된다
검정은 실제 개수와 표본 크기를 필요로 합니다.
성별과 상품 선택 자료를 처음부터 끝까지
관측표가 독립에서 멀어질수록 χ²가 어떻게 변하는지 관찰합니다
행·열 합계를 유지한 채 대각선 셀의 빈도를 이동해보세요. 기대빈도와의 차이가 커질수록 χ²가 증가합니다.
남·A
45남·B
55여·A
45여·B
550.00
독립 가정과 크게 충돌하지 않음
카이제곱 검정 인터랙티브 랩
효과와 불확실성을 바꾸며 두 분포의 겹침, 검정통계량과 판단 경계가 함께 움직이는지 보세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
현재 조건
1.0 · 1.1
조절값과 그래프의 변화를 함께 확인하세요.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
관찰할 것
관측빈도를 바꿔보기
카이제곱 검정에서 기억해야 할 판단 규칙
표의 구조에 따라 확장 방법이 달라집니다
| 주제 | 핵심 내용 |
|---|---|
| Fisher 정확검정 | 작은 2×2 표에서 정확한 확률을 계산합니다. |
| 표준화 잔차 | 각 셀이 전체 χ²에 기여한 방향과 크기를 보여줍니다. |
| 오즈비 | 2×2 표에서 연관성의 방향과 배수를 나타냅니다. |
| 로그선형 모형 | 여러 범주형 변수의 고차원 교차표를 분석합니다. |
| 로지스틱 회귀 | 이분형 결과에 여러 예측변수와 교란변수를 함께 반영합니다. |
다음 연결
카이제곱은 범주형 자료의 비모수적 분석 중 하나입니다. 순서나 중앙 위치를 비교하는 자료에는 다른 비모수 검정이 필요합니다.