현재 본문을 보고 있습니다
배우기
인터랙티브·

분산분석(ANOVA)

세 집단 이상의 평균이 서로 다른지 한 번에 확인합니다.

1

들어가며

평균이 다르면 수업 방식의 효과도 다르다고 말해도 될까?

강의식, 토론식, 프로젝트식 수업을 받은 학생들의 평균 점수가 각각 72점, 78점, 84점이라고 해봅시다. 표본에서 세 평균은 분명히 다릅니다.

강의식평균 72
토론식평균 78
프로젝트식평균 84

세 표본평균은 72점, 78점, 84점으로 서로 다릅니다.

하지만 다른 학생들을 뽑았다면 세 평균의 간격도 달라졌을 수 있습니다. 지금 보이는 차이가 수업 방식 때문인지, 우연히 이런 학생들이 표본에 포함되었기 때문인지는 평균만 보고 판단할 수 없습니다.

핵심 질문

표본에서 관측된 세 집단의 평균 차이를 모집단의 차이로 볼 만한 근거가 충분할까요?

집단 간 변동

신호

각 집단평균이 전체평균에서 떨어진 정도를 비교합니다.

집단 내 변동

잡음

같은 집단 안에서 개인값이 흩어진 정도를 계산합니다.

F 비율

분산의 비

집단 간 변동을 집단 내 변동으로 나눠 평균 차이를 검정합니다.

1

개념

여러 평균을 비교하는 원리부터 차근차근

2

무엇을 알아보는 분석인가

ANOVA는 여러 집단의 평균을 비교하는 가설검정입니다

분산분석은 세 집단 이상의 평균을 한 번에 비교합니다. 모든 모집단 평균이 같다는 가설을 세우고, 자료에서 그 가설과 맞지 않는 차이가 나타났는지 판단합니다.

상황확인하려는 질문사용할 분석
한 요인의 서로 다른 집단세 수업 방식의 평균 점수가 다른가?일원분산분석
두 요인을 함께 비교수업 방식과 성별의 효과가 다른가?이원분산분석
같은 대상을 여러 번 측정세 시점의 평균 혈압이 다른가?반복측정 분산분석

ANOVA가 검정하는 가설

영가설은 모든 모집단 평균이 같다는 것입니다. 대립가설은 모든 평균이 각각 다르다는 뜻이 아니라, 적어도 하나의 평균이 다르다는 뜻입니다.

3

왜 t검정을 여러 번 하면 안 되는가

비교가 늘어날수록 우연한 차이를 발견할 가능성도 커집니다

세 집단을 A–B, A–C, B–C로 나누어 각각 t검정하면 검정을 세 번 하게 됩니다. 집단이 다섯 개면 비교는 열 번으로 늘어납니다. 실제 차이가 없어도 반복할수록 우연히 p값이 .05보다 작게 나오는 비교를 하나 이상 발견할 가능성이 커집니다.

집단 수쌍별 비교 수각 검정을 α=.05로 할 때의 문제
3개3회거짓 양성의 전체 위험이 .05보다 커집니다.
5개10회우연히 유의한 비교가 나올 가능성이 더 커집니다.
10개45회개별 p값만으로는 전체 오류를 통제하기 어렵습니다.

ANOVA는 먼저 모든 집단을 하나의 검정으로 비교해 전체 오류율을 관리합니다. 전체 차이가 확인된 뒤에만 보정된 사후검정으로 어느 집단이 다른지 찾습니다.

4

핵심 원리

집단 간 변동을 집단 내 변동과 비교합니다

집단 평균들이 서로 멀리 떨어져 있을수록 집단 간 변동은 커집니다. 반대로 같은 집단 안의 값들이 크게 흩어져 있으면, 평균 차이가 우연히 생겼을 가능성도 커집니다.

집단 간 변동

A 평균

B 평균

C 평균

각 집단의 평균이 전체 평균에서 떨어진 정도

집단 내 변동

A
B
C

같은 집단 안에서 개인의 값이 흩어진 정도

F=MSbetweenMSwithinF=\frac{MS_{\text{between}}}{MS_{\text{within}}}
일원분산분석에서 집단 간 평균제곱을 집단 내 평균제곱으로 나눕니다.

두 변동이 비슷하면 F값은 1에 가깝습니다. 집단 평균의 차이가 집단 내부의 자연스러운 산포보다 훨씬 크면 F값도 커지고, 모든 모집단 평균이 같다는 가설과 맞지 않는 결과가 됩니다.

숫자로 읽기

집단 간 평균제곱이 180이고 집단 내 평균제곱이 10이면 F값은 18입니다. 집단 사이에서 관측된 변동이 같은 집단 안의 변동보다 18배 크다는 뜻입니다.

2

왜 중요한가

t검정을 여러 번 하면 안 되는 이유

5

어떤 방법을 선택하는가

요인의 수와 측정 구조가 분석을 결정합니다

질문자료 구조선택
독립된 여러 집단을 한 요인으로 나누었는가?세 수업 방식일원분산분석
두 요인의 효과와 상호작용을 보는가?수업 방식 × 학년이원분산분석
같은 대상을 여러 조건에서 측정했는가?치료 전·1개월·3개월반복측정 ANOVA
공변량을 통제한 평균을 비교하는가?사전점수를 통제한 수업 비교ANCOVA

일원분산분석의 ‘일원’

결과변수가 하나라는 뜻이 아니라, 집단을 나누는 요인이 하나라는 뜻입니다. 수업 방식이라는 한 요인에 강의식·토론식·프로젝트식 세 수준이 있는 구조입니다.

독립된 집단의 분산이 크게 다르면 일반 ANOVA 대신 Welch ANOVA를 검토합니다.

6

분석은 어떻게 이루어지는가

연구 질문 확인부터 사후검정까지

단계하는 일
1비교할 결과변수와 집단을 나누는 요인을 정합니다.
2독립집단·반복측정 등 자료의 구조에 맞는 ANOVA를 선택합니다.
3각 집단의 평균과 전체 평균을 계산합니다.
4전체 변동을 집단 간 변동과 집단 내 변동으로 나눕니다.
5두 평균제곱의 비율로 F값을 계산합니다.
6F분포를 이용해 p값을 구하고 전체 평균 차이를 판단합니다.
7유의하다면 사후검정으로 어느 집단이 다른지 확인합니다.
8효과크기와 신뢰구간으로 차이의 실제 크기를 해석합니다.

프로그램은 계산을 수행하지만, 어떤 ANOVA를 사용할지와 사후검정이 필요한지, 통계적으로 유의한 차이가 실제로도 중요한지는 사람이 판단해야 합니다.

7

결과는 어떻게 읽는가

전체 차이, 차이가 있는 집단, 효과의 크기를 차례로 봅니다

집단 평균

72 · 78 · 84

F값

54.00

자유도

2, 27

p값

< .001

η²

.80

유의한 F검정은 적어도 한 집단의 평균이 다르다는 뜻이며, 어느 집단인지는 사후검정으로 확인합니다.

결과읽는 질문
집단별 평균어느 집단이 높고 평균 차이는 얼마나 되는가?
F값과 자유도집단 간 변동이 집단 내 변동보다 얼마나 큰가?
p값모든 모집단 평균이 같다는 가정에서 현재 결과가 얼마나 드문가?
사후검정구체적으로 어느 집단과 어느 집단이 다른가?
효과크기전체 변동 중 집단 차이가 설명하는 비율은 어느 정도인가?

해석 순서

먼저 평균과 분포를 확인하고, 전체 F검정으로 차이의 존재를 판단합니다. 유의한 경우 사후검정으로 위치를 찾고, 효과크기와 맥락으로 실제 중요성을 평가합니다.

3

작동 원리

F값이 만들어지고 사후검정으로 이어지는 과정

8

대표 사례

세 가지 수업 방식의 시험 점수를 처음부터 끝까지 분석합니다

수업 방식별 시험 점수

강의식: 68 · 69 · 70 · 71 · 72 · 72 · 73 · 74 · 75 · 76
토론식: 74 · 75 · 76 · 77 · 78 · 78 · 79 · 80 · 81 · 82
프로젝트식: 80 · 81 · 82 · 83 · 84 · 84 · 85 · 86 · 87 · 88

서로 다른 학생들이 세 수업 방식 중 하나에 참여했으므로 일원분산분석을 사용합니다. 집단별 평균은 72점, 78점, 84점이며 전체 평균은 78점입니다.

결과
집단 평균72.0 · 78.0 · 84.0
F값54.00
자유도(2, 27)
p값< .001
효과크기 η².80
Tukey 사후검정프로젝트식 > 토론식 > 강의식

결과 해석

수업 방식에 따라 평균 시험 점수가 유의하게 달랐습니다 (F(2, 27)=54.00, p<.001, η²=.80). Tukey 사후검정에서는 프로젝트식, 토론식, 강의식 수업 순으로 평균이 높았으며 세 쌍의 차이가 모두 유의했습니다. 이 자료에서는 수업 방식이 점수 차이와 강하게 관련되어 있습니다.

9

가정과 주의점

결과를 크게 왜곡하는 항목부터 확인합니다

우선순위확인할 것문제가 생기면
1관측값의 독립성반복측정·학급 군집을 무시하면 표준오차가 잘못됩니다.
2극단적 이상치집단 평균과 집단 내 분산이 크게 달라질 수 있습니다.
3집단별 분포작고 심하게 치우친 집단에서는 결과가 불안정할 수 있습니다.
4분산의 동질성분산 차이가 크면 Welch ANOVA를 검토합니다.
5집단별 표본 크기불균형한 표본과 분산 차이가 함께 있으면 왜곡이 커집니다.

정규성 검정과 등분산성 검정의 p값만 기계적으로 따르지 말고, 상자그림과 원자료의 분포, 집단별 표본 크기, 연구 설계를 함께 확인해야 합니다.

10

흔한 오해

ANOVA 결과를 잘못 읽는 대표적인 경우

오해 1 · 유의하면 모든 집단이 서로 다르다

전체 F검정은 적어도 한 평균이 다르다는 것만 알려줍니다. 구체적인 차이는 사후검정으로 확인합니다.

오해 2 · F값이 크면 차이가 몇 점인지 알 수 있다

F값은 변동의 비율입니다. 점수 차이는 집단 평균과 신뢰구간에서 읽어야 합니다.

오해 3 · p값이 작으면 효과가 크다

표본이 크면 작은 차이도 유의할 수 있으므로 η²나 ω² 같은 효과크기를 함께 봅니다.

오해 4 · 유의하지 않으면 모든 평균이 같다

같다는 증명이 아니라, 현재 자료로 차이를 확인할 근거가 부족하다는 뜻입니다.

4

예시

세 가지 수업 방식의 점수를 처음부터 끝까지 분석하기

11

직접 해보기

집단 간 차이·집단 내 산포·표본 크기가 F값을 어떻게 바꾸는지 관찰합니다

집단 평균의 간격을 넓히고, 집단 안의 산포를 키우거나 줄이고, 표본 크기를 바꿔보세요. 세 요소가 F값과 통계적 근거에 어떤 영향을 주는지 확인합니다.

변동의 비율을 단순화한 시뮬레이션

F ≈ 11.25

근거가 강함

평균 간격과 표본 크기가 커질수록 F값은 커지고, 집단 내 산포가 커질수록 작아집니다.

분산분석(ANOVA) 인터랙티브 랩

효과와 불확실성을 바꾸며 두 분포의 겹침, 검정통계량과 판단 경계가 함께 움직이는지 보세요.

집단 A집단 B집단 C

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

현재 조건

1.0 · 1.1

조절값과 그래프의 변화를 함께 확인하세요.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

관찰할 것

  • 집단 평균의 간격이 커질수록 F값이 어떻게 변하는지 확인합니다.
  • 집단 안의 산포가 커질수록 같은 평균 차이의 F값이 어떻게 변하는지 봅니다.
  • 표본 크기가 커질수록 같은 차이를 더 안정적으로 탐지하는지 확인합니다.
  • 유의한 전체 검정만으로 어느 집단이 다른지 알 수 없는 이유를 생각해봅니다.
5

직접 해보기

평균 간격·산포·표본 크기를 바꿔보기

12

핵심 정리

ANOVA를 사용할 때 기억해야 할 판단 규칙

핵심 정리

  • ANOVA는 세 집단 이상에서 모든 모집단 평균이 같다는 가설을 검정한다.
  • F값은 집단 간 변동을 집단 내 변동과 비교한 값이다.
  • 유의한 F검정은 적어도 한 집단의 평균이 다르다는 뜻이다.
  • 어느 집단이 다른지는 보정된 사후검정으로 확인한다.
  • 결과는 집단 평균, F값, p값, 사후검정, 효과크기를 함께 읽는다.
  • 가장 중요한 확인 사항은 독립성, 이상치, 분산 차이, 표본의 불균형이다.
13

더 깊이 알아보기

공식과 확장은 핵심 흐름을 이해한 뒤 확인합니다

주제핵심 내용
자유도집단 간 자유도는 k−1, 집단 내 자유도는 N−k입니다.
Tukey 사후검정모든 쌍을 비교하면서 전체 오류율을 통제합니다.
Welch ANOVA집단의 분산과 표본 크기가 다를 때 더 안전한 대안입니다.
효과크기η²와 ω²는 전체 변동 중 집단 차이가 설명하는 비율을 나타냅니다.
반복측정 ANOVA같은 대상을 여러 번 측정한 자료의 개인차를 분리합니다.
비모수 대안서열자료나 심한 비대칭에서는 Kruskal–Wallis 검정을 검토합니다.

ANOVA는 출발점

전체 검정은 차이가 존재하는지를 알려줍니다. 실제 결론을 내려면 집단별 평균과 신뢰구간, 사후검정, 효과크기, 연구 맥락까지 이어서 확인해야 합니다.

다음: 카이제곱 검정