현재 본문을 보고 있습니다
배우기
인터랙티브·

표본분포와 중심극한정리

표본 하나가 아니라, 가능한 모든 표본의 평균을 생각합니다.

한 쇼핑몰의 고객 주문금액은 대부분 작지만 가끔 매우 큰 주문이 섞여 있어 오른쪽으로 길게 치우쳐 있다고 해봅시다. 여기서 고객 30명을 뽑아 평균 주문금액을 계산하면 하나의 평균이 나옵니다. 하지만 다른 30명을 뽑으면 평균은 조금 달라집니다.

통계는 처음 뽑은 표본 하나만 바라보지 않습니다. 같은 크기의 표본을 모집단에서 계속 다시 뽑는다고 상상하고, 그때마다 계산되는 표본평균 전체의 분포를 생각합니다. 이것이 표본분포입니다.

같은 모집단에서 n=30 표본을 반복 추출

표본 1 평균: 52.4 · 표본 2 평균: 48.9 · 표본 3 평균: 51.7 · 표본 4 평균: 50.6

핵심 질문

표본평균은 반복해서 뽑을 때 어떤 모양으로, 얼마나 넓게 퍼질까요?

원자료 분포

한 번

개별 관측값의 분포는 비대칭이거나 봉우리가 여러 개일 수 있습니다.

표본평균 반복

여러 번

같은 크기의 표본을 반복해 평균을 하나씩 기록합니다.

평균의 분포

CLT

표본이 커지면 표본평균의 분포가 정규형에 가까워집니다.

표본분포는 원자료의 분포가 아닙니다

분포무엇이 들어가는가질문
모집단 분포모든 개인의 관측값개별 주문금액은 어떻게 퍼져 있는가?
표본 분포현재 표본 안의 관측값이번에 뽑은 30명의 주문금액은 어떤가?
표본평균의 표본분포반복 추출한 각 표본의 평균평균은 반복할 때 어떻게 흔들리는가?

중심극한정리가 설명하는 대상은 세 번째입니다. 개인 주문금액이 정규분포가 된다는 뜻이 아니라, 여러 표본에서 계산한 평균들의 분포가 정규분포에 가까워진다는 뜻입니다.

표본평균의 중심은 모집단 평균에 놓입니다

어떤 표본은 모집단 평균보다 높고 어떤 표본은 낮지만, 무작위 표집을 반복하면 표본평균들은 모집단 평균 주변에 모입니다. 표본평균의 기대값은 모집단 평균과 같습니다.

표본평균의 중심

E(Xˉ)=μE(\bar{X})=\mu

한 표본이 정확하다는 뜻은 아닙니다

표본평균이 평균적으로 맞는다는 말은 모든 표본이 모집단 평균과 같다는 뜻이 아닙니다. 여러 표본의 오차가 장기적으로 서로 상쇄된다는 뜻입니다.

표본이 커질수록 평균의 흔들림은 작아집니다

표본 크기표본평균의 특징
n=5어떤 사람이 뽑혔는지에 따라 평균이 크게 흔들림
n=30극단적인 값 하나의 영향이 줄어듦
n=100평균이 모집단 평균 주변에 더 촘촘히 모임

표본 크기가 네 배가 되면 평균의 흔들림은 대략 절반으로 줄어듭니다. 표본이 커질수록 정보가 늘지만, 오차가 표본 수에 정비례해 줄어드는 것은 아닙니다.

중심극한정리는 표본평균의 모양을 설명합니다

모집단이 비대칭이거나 정규분포가 아니어도, 독립적인 관측값을 충분히 많이 평균내면 표본평균의 분포는 정규분포에 가까워집니다. 그래서 정규분포를 이용한 신뢰구간과 가설검정이 넓은 상황에서 작동할 수 있습니다.

조건의미
무작위성·대표성표본이 모집단을 체계적으로 왜곡하지 않아야 함
독립성한 관측값이 다른 관측값을 사실상 복제하지 않아야 함
충분한 표본 크기모집단의 비대칭과 꼬리가 심할수록 더 큰 n이 필요함
유한한 변동극단적으로 불안정한 분포에서는 일반적인 CLT 적용이 어려울 수 있음

n=30은 법칙이 아닙니다

모집단이 거의 대칭이면 더 작은 표본도 충분할 수 있고, 매우 치우쳤거나 극단값이 많으면 n=30으로 부족할 수 있습니다. 그래프와 데이터 생성 과정을 함께 확인해야 합니다.

표본분포가 추론통계를 가능하게 합니다

통계 절차표본분포가 하는 역할
표준오차통계량이 표본마다 흔들리는 전형적인 크기를 나타냄
신뢰구간표본평균 주변에 모집단 평균의 가능한 범위를 만듦
가설검정귀무가설 아래 현재 통계량이 얼마나 드문지 계산
p값표본분포의 꼬리 영역을 이용해 극단성을 평가

표본분포를 모르면 표본평균이 50이라는 사실만 알 수 있습니다. 표본분포를 알면 50이 얼마나 정확한지, 48이나 52도 가능한지, 기준값과 차이가 충분히 큰지 판단할 수 있습니다.

치우친 모집단에서 표본평균을 반복해보기

원래 모집단은 오른쪽으로 크게 치우쳐 있습니다. 표본 크기와 반복 횟수를 늘려 표본평균의 분포가 어떻게 좁아지고 가운데가 매끄러워지는지 확인해보세요.

모집단 평균

7.00

표본평균들의 평균

6.55

표본평균 범위

1.317.3

표본분포와 중심극한정리 인터랙티브 랩

표본을 다시 뽑고 표본 크기를 바꾸며 추정량의 흔들림과 구간 폭을 직접 비교하세요.

모집단 평균표본평균

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

현재 조건

103 · 28

조절값과 그래프의 변화를 함께 확인하세요.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

관찰할 것

  • n=1일 때 표본평균 분포가 원래 모집단과 비슷한지 확인합니다.
  • 표본 크기를 키울수록 분포가 더 대칭적인 모양에 가까워지는지 봅니다.
  • 표본평균들의 평균이 모집단 평균 근처에 놓이는지 확인합니다.
  • 반복 횟수를 늘리면 표본분포의 모양이 더 안정적으로 보이는지 살펴봅니다.

핵심 정리

  • 표본분포는 같은 크기의 표본을 반복 추출해 계산한 통계량들의 분포다.
  • 표본평균의 표본분포는 모집단 평균을 중심으로 형성된다.
  • 표본 크기가 커질수록 표본평균의 분포는 좁아진다.
  • 중심극한정리는 조건이 충족될 때 표본평균의 분포가 정규분포에 가까워짐을 설명한다.
  • 표준오차, 신뢰구간, 가설검정은 모두 표본분포 위에서 만들어진다.

가장 중요한 구분

중심극한정리는 원자료가 정규분포가 된다는 말이 아니라, 표본평균들의 분포가 정규분포에 가까워진다는 말입니다.

다음: 표준오차(SE)