세 집단 이상의 평균이 서로 다른지 한 번에 확인합니다.
평균이 다르면 수업 방식의 효과도 다르다고 말해도 될까?
강의식, 토론식, 프로젝트식 수업을 받은 학생들의 평균 점수가 각각 72점, 78점, 84점이라고 해봅시다. 표본에서 세 평균은 분명히 다릅니다.
세 표본평균은 72점, 78점, 84점으로 서로 다릅니다.
하지만 다른 학생들을 뽑았다면 세 평균의 간격도 달라졌을 수 있습니다. 지금 보이는 차이가 수업 방식 때문인지, 우연히 이런 학생들이 표본에 포함되었기 때문인지는 평균만 보고 판단할 수 없습니다.
핵심 질문
표본에서 관측된 세 집단의 평균 차이를 모집단의 차이로 볼 만한 근거가 충분할까요?
각 집단평균이 전체평균에서 떨어진 정도를 비교합니다.
같은 집단 안에서 개인값이 흩어진 정도를 계산합니다.
집단 간 변동을 집단 내 변동으로 나눠 평균 차이를 검정합니다.
여러 평균을 비교하는 원리부터 차근차근
ANOVA는 여러 집단의 평균을 비교하는 가설검정입니다
분산분석은 세 집단 이상의 평균을 한 번에 비교합니다. 모든 모집단 평균이 같다는 가설을 세우고, 자료에서 그 가설과 맞지 않는 차이가 나타났는지 판단합니다.
| 상황 | 확인하려는 질문 | 사용할 분석 |
|---|---|---|
| 한 요인의 서로 다른 집단 | 세 수업 방식의 평균 점수가 다른가? | 일원분산분석 |
| 두 요인을 함께 비교 | 수업 방식과 성별의 효과가 다른가? | 이원분산분석 |
| 같은 대상을 여러 번 측정 | 세 시점의 평균 혈압이 다른가? | 반복측정 분산분석 |
ANOVA가 검정하는 가설
영가설은 모든 모집단 평균이 같다는 것입니다. 대립가설은 모든 평균이 각각 다르다는 뜻이 아니라, 적어도 하나의 평균이 다르다는 뜻입니다.
비교가 늘어날수록 우연한 차이를 발견할 가능성도 커집니다
세 집단을 A–B, A–C, B–C로 나누어 각각 t검정하면 검정을 세 번 하게 됩니다. 집단이 다섯 개면 비교는 열 번으로 늘어납니다. 실제 차이가 없어도 반복할수록 우연히 p값이 .05보다 작게 나오는 비교를 하나 이상 발견할 가능성이 커집니다.
| 집단 수 | 쌍별 비교 수 | 각 검정을 α=.05로 할 때의 문제 |
|---|---|---|
| 3개 | 3회 | 거짓 양성의 전체 위험이 .05보다 커집니다. |
| 5개 | 10회 | 우연히 유의한 비교가 나올 가능성이 더 커집니다. |
| 10개 | 45회 | 개별 p값만으로는 전체 오류를 통제하기 어렵습니다. |
ANOVA는 먼저 모든 집단을 하나의 검정으로 비교해 전체 오류율을 관리합니다. 전체 차이가 확인된 뒤에만 보정된 사후검정으로 어느 집단이 다른지 찾습니다.
집단 간 변동을 집단 내 변동과 비교합니다
집단 평균들이 서로 멀리 떨어져 있을수록 집단 간 변동은 커집니다. 반대로 같은 집단 안의 값들이 크게 흩어져 있으면, 평균 차이가 우연히 생겼을 가능성도 커집니다.
집단 간 변동
A 평균
B 평균
C 평균
각 집단의 평균이 전체 평균에서 떨어진 정도
집단 내 변동
같은 집단 안에서 개인의 값이 흩어진 정도
두 변동이 비슷하면 F값은 1에 가깝습니다. 집단 평균의 차이가 집단 내부의 자연스러운 산포보다 훨씬 크면 F값도 커지고, 모든 모집단 평균이 같다는 가설과 맞지 않는 결과가 됩니다.
숫자로 읽기
집단 간 평균제곱이 180이고 집단 내 평균제곱이 10이면 F값은 18입니다. 집단 사이에서 관측된 변동이 같은 집단 안의 변동보다 18배 크다는 뜻입니다.
t검정을 여러 번 하면 안 되는 이유
요인의 수와 측정 구조가 분석을 결정합니다
| 질문 | 자료 구조 | 선택 |
|---|---|---|
| 독립된 여러 집단을 한 요인으로 나누었는가? | 세 수업 방식 | 일원분산분석 |
| 두 요인의 효과와 상호작용을 보는가? | 수업 방식 × 학년 | 이원분산분석 |
| 같은 대상을 여러 조건에서 측정했는가? | 치료 전·1개월·3개월 | 반복측정 ANOVA |
| 공변량을 통제한 평균을 비교하는가? | 사전점수를 통제한 수업 비교 | ANCOVA |
일원분산분석의 ‘일원’
결과변수가 하나라는 뜻이 아니라, 집단을 나누는 요인이 하나라는 뜻입니다. 수업 방식이라는 한 요인에 강의식·토론식·프로젝트식 세 수준이 있는 구조입니다.
독립된 집단의 분산이 크게 다르면 일반 ANOVA 대신 Welch ANOVA를 검토합니다.
연구 질문 확인부터 사후검정까지
| 단계 | 하는 일 |
|---|---|
| 1 | 비교할 결과변수와 집단을 나누는 요인을 정합니다. |
| 2 | 독립집단·반복측정 등 자료의 구조에 맞는 ANOVA를 선택합니다. |
| 3 | 각 집단의 평균과 전체 평균을 계산합니다. |
| 4 | 전체 변동을 집단 간 변동과 집단 내 변동으로 나눕니다. |
| 5 | 두 평균제곱의 비율로 F값을 계산합니다. |
| 6 | F분포를 이용해 p값을 구하고 전체 평균 차이를 판단합니다. |
| 7 | 유의하다면 사후검정으로 어느 집단이 다른지 확인합니다. |
| 8 | 효과크기와 신뢰구간으로 차이의 실제 크기를 해석합니다. |
프로그램은 계산을 수행하지만, 어떤 ANOVA를 사용할지와 사후검정이 필요한지, 통계적으로 유의한 차이가 실제로도 중요한지는 사람이 판단해야 합니다.
전체 차이, 차이가 있는 집단, 효과의 크기를 차례로 봅니다
집단 평균
72 · 78 · 84
F값
54.00
자유도
2, 27
p값
< .001
η²
.80
유의한 F검정은 적어도 한 집단의 평균이 다르다는 뜻이며, 어느 집단인지는 사후검정으로 확인합니다.
| 결과 | 읽는 질문 |
|---|---|
| 집단별 평균 | 어느 집단이 높고 평균 차이는 얼마나 되는가? |
| F값과 자유도 | 집단 간 변동이 집단 내 변동보다 얼마나 큰가? |
| p값 | 모든 모집단 평균이 같다는 가정에서 현재 결과가 얼마나 드문가? |
| 사후검정 | 구체적으로 어느 집단과 어느 집단이 다른가? |
| 효과크기 | 전체 변동 중 집단 차이가 설명하는 비율은 어느 정도인가? |
해석 순서
먼저 평균과 분포를 확인하고, 전체 F검정으로 차이의 존재를 판단합니다. 유의한 경우 사후검정으로 위치를 찾고, 효과크기와 맥락으로 실제 중요성을 평가합니다.
F값이 만들어지고 사후검정으로 이어지는 과정
세 가지 수업 방식의 시험 점수를 처음부터 끝까지 분석합니다
수업 방식별 시험 점수
강의식: 68 · 69 · 70 · 71 · 72 · 72 · 73 · 74 · 75 · 76
토론식: 74 · 75 · 76 · 77 · 78 · 78 · 79 · 80 · 81 · 82
프로젝트식: 80 · 81 · 82 · 83 · 84 · 84 · 85 · 86 · 87 · 88
서로 다른 학생들이 세 수업 방식 중 하나에 참여했으므로 일원분산분석을 사용합니다. 집단별 평균은 72점, 78점, 84점이며 전체 평균은 78점입니다.
| 결과 | 값 |
|---|---|
| 집단 평균 | 72.0 · 78.0 · 84.0 |
| F값 | 54.00 |
| 자유도 | (2, 27) |
| p값 | < .001 |
| 효과크기 η² | .80 |
| Tukey 사후검정 | 프로젝트식 > 토론식 > 강의식 |
결과 해석
수업 방식에 따라 평균 시험 점수가 유의하게 달랐습니다 (F(2, 27)=54.00, p<.001, η²=.80). Tukey 사후검정에서는 프로젝트식, 토론식, 강의식 수업 순으로 평균이 높았으며 세 쌍의 차이가 모두 유의했습니다. 이 자료에서는 수업 방식이 점수 차이와 강하게 관련되어 있습니다.
결과를 크게 왜곡하는 항목부터 확인합니다
| 우선순위 | 확인할 것 | 문제가 생기면 |
|---|---|---|
| 1 | 관측값의 독립성 | 반복측정·학급 군집을 무시하면 표준오차가 잘못됩니다. |
| 2 | 극단적 이상치 | 집단 평균과 집단 내 분산이 크게 달라질 수 있습니다. |
| 3 | 집단별 분포 | 작고 심하게 치우친 집단에서는 결과가 불안정할 수 있습니다. |
| 4 | 분산의 동질성 | 분산 차이가 크면 Welch ANOVA를 검토합니다. |
| 5 | 집단별 표본 크기 | 불균형한 표본과 분산 차이가 함께 있으면 왜곡이 커집니다. |
정규성 검정과 등분산성 검정의 p값만 기계적으로 따르지 말고, 상자그림과 원자료의 분포, 집단별 표본 크기, 연구 설계를 함께 확인해야 합니다.
ANOVA 결과를 잘못 읽는 대표적인 경우
오해 1 · 유의하면 모든 집단이 서로 다르다
전체 F검정은 적어도 한 평균이 다르다는 것만 알려줍니다. 구체적인 차이는 사후검정으로 확인합니다.
오해 2 · F값이 크면 차이가 몇 점인지 알 수 있다
F값은 변동의 비율입니다. 점수 차이는 집단 평균과 신뢰구간에서 읽어야 합니다.
오해 3 · p값이 작으면 효과가 크다
표본이 크면 작은 차이도 유의할 수 있으므로 η²나 ω² 같은 효과크기를 함께 봅니다.
오해 4 · 유의하지 않으면 모든 평균이 같다
같다는 증명이 아니라, 현재 자료로 차이를 확인할 근거가 부족하다는 뜻입니다.
세 가지 수업 방식의 점수를 처음부터 끝까지 분석하기
집단 간 차이·집단 내 산포·표본 크기가 F값을 어떻게 바꾸는지 관찰합니다
집단 평균의 간격을 넓히고, 집단 안의 산포를 키우거나 줄이고, 표본 크기를 바꿔보세요. 세 요소가 F값과 통계적 근거에 어떤 영향을 주는지 확인합니다.
변동의 비율을 단순화한 시뮬레이션
F ≈ 11.25
근거가 강함
평균 간격과 표본 크기가 커질수록 F값은 커지고, 집단 내 산포가 커질수록 작아집니다.
분산분석(ANOVA) 인터랙티브 랩
효과와 불확실성을 바꾸며 두 분포의 겹침, 검정통계량과 판단 경계가 함께 움직이는지 보세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
현재 조건
1.0 · 1.1
조절값과 그래프의 변화를 함께 확인하세요.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
관찰할 것
평균 간격·산포·표본 크기를 바꿔보기
ANOVA를 사용할 때 기억해야 할 판단 규칙
공식과 확장은 핵심 흐름을 이해한 뒤 확인합니다
| 주제 | 핵심 내용 |
|---|---|
| 자유도 | 집단 간 자유도는 k−1, 집단 내 자유도는 N−k입니다. |
| Tukey 사후검정 | 모든 쌍을 비교하면서 전체 오류율을 통제합니다. |
| Welch ANOVA | 집단의 분산과 표본 크기가 다를 때 더 안전한 대안입니다. |
| 효과크기 | η²와 ω²는 전체 변동 중 집단 차이가 설명하는 비율을 나타냅니다. |
| 반복측정 ANOVA | 같은 대상을 여러 번 측정한 자료의 개인차를 분리합니다. |
| 비모수 대안 | 서열자료나 심한 비대칭에서는 Kruskal–Wallis 검정을 검토합니다. |
ANOVA는 출발점
전체 검정은 차이가 존재하는지를 알려줍니다. 실제 결론을 내려면 집단별 평균과 신뢰구간, 사후검정, 효과크기, 연구 맥락까지 이어서 확인해야 합니다.