표본이 커질수록 평균이 안정되고 정규분포가 나타나는 이유
동전 10번의 앞면 비율은 크게 흔들리지만 10만 번의 비율은 거의 0.5에 붙습니다.
큰 수의 법칙은 반복할수록 표본평균이 모집단평균에 가까워진다고 말합니다. 중심극한정리는 반복해서 뽑은 표본평균들의 분포가 어떤 모양이 되는지 말합니다.
두 정리는 함께 통계추론의 토대가 되지만 같은 정리가 아닙니다. 하나는 한 표본평균의 수렴, 다른 하나는 표본평균의 표본분포에 관한 결과입니다.
반드시 구분할 것
큰 수의 법칙은 “어디로 가는가”, 중심극한정리는 “어떤 모양으로 얼마나 흔들리는가”에 답합니다.
시행이 늘수록 표본평균이 모집단 기댓값에 가까워집니다.
같은 크기의 표본평균들은 중심 주변에서 계속 달라집니다.
적절한 조건에서 표준화한 합과 평균이 정규분포에 가까워집니다.
같은 모집단에서 크기 n인 표본을 다시 뽑으면 매번 포함되는 관측값이 달라져 표본평균 x̄도 달라집니다.
이렇게 반복 가능한 통계량의 분포를 표본분포라고 합니다. 표본평균의 기대값은 모집단평균 μ이고 표준편차는 σ/√n입니다.
독립적이고 같은 분포에서 나온 관측값의 평균은 표본크기 n이 커질수록 모집단 기댓값 μ에 가까워집니다.
동전의 앞면을 1, 뒷면을 0으로 두면 표본평균은 앞면 비율입니다. 공정한 동전을 많이 던질수록 이 비율은 E(X)=0.5 근처에 머뭅니다.
n이 커져도 무작위 오차가 완전히 사라지는 것은 아닙니다. 다만 일정한 오차 범위를 벗어날 확률이 작아집니다.
또한 큰 수의 법칙은 표본이 편향되었거나 관측이 강하게 의존할 때 자동으로 구해주지 않습니다. 잘못된 방식으로 많이 모은 자료는 잘못된 값에 정밀하게 가까워질 수 있습니다.
큰 표본은 편향을 고치지 못합니다
표본크기는 무작위오차를 줄이지만 선택편향, 측정오류, 누락된 집단 같은 체계적 오류는 그대로 남습니다.
모집단의 평균 μ와 유한한 분산 σ²이 있고 관측이 적절히 독립이면, n이 커질수록 표준화한 표본평균의 분포는 표준정규분포에 가까워집니다.
원자료가 정규분포일 필요는 없습니다. 오른쪽으로 치우친 자료나 0·1 자료에서도 충분히 큰 표본의 평균은 대체로 종 모양이 됩니다.
중심극한정리는 원자료가 정규분포로 변한다고 말하지 않습니다. 정규분포에 가까워지는 대상은 반복해서 계산한 합 또는 평균의 분포입니다.
| 구분 | 무엇을 모은 것? | n이 커지면 |
|---|---|---|
| 모집단분포 | 개별 관측값 X | 모양이 바뀌지 않음 |
| 표본분포 | 반복 표본의 평균 X̄ | 정규형에 가까워짐 |
| 한 표본의 히스토그램 | 현재 표본의 개별 값 | 모집단 모양을 근사 |
표본평균의 표준오차는 σ/√n이므로 표본크기를 4배로 늘려야 흔들림이 절반이 됩니다. 2배로 늘리면 약 1/√2, 즉 70.7%로 줄어듭니다.
정밀도를 조금 더 높이려면 필요한 표본이 빠르게 커집니다. 이것이 큰 자료 수집에도 비용 대비 효과가 점차 줄어드는 이유입니다.
모집단평균 50, 표준편차 12에서 n=36인 표본평균을 생각합니다.
표준오차는 12/√36=2입니다. 중심극한정리에 따라 표본평균의 약 95%는 μ±1.96SE, 즉 50±3.92인 46.08~53.92 사이에 놓입니다.
n=144라면 SE=1로 줄어 같은 범위가 48.04~51.96으로 좁아집니다.
“n≥30이면 무조건 정규”는 규칙이 아니라 거친 경험법칙입니다. 대칭적이고 꼬리가 가벼운 모집단은 작은 n에서도 빠르게 근사되지만, 심한 비대칭·극단값·무거운 꼬리는 훨씬 큰 n이 필요합니다.
비율에서는 np와 n(1−p)가 충분히 커야 정규근사가 안정적입니다. 희귀사건에서는 전체 n이 커도 예상 성공 수가 작아 근사가 나쁠 수 있습니다.
| 상황 | 확인할 점 |
|---|---|
| 대칭·가벼운 꼬리 | 비교적 작은 n에서도 평균이 안정 |
| 강한 비대칭 | 더 큰 n과 시뮬레이션 확인 |
| 극단값·무거운 꼬리 | 평균이 불안정할 수 있음 |
| 표본비율 | np와 n(1−p)가 충분한지 |
| 질문 | 큰 수의 법칙 | 중심극한정리 |
|---|---|---|
| 핵심 대상 | 한 표본의 평균 | 반복 표본평균의 분포 |
| 말해주는 것 | μ에 가까워짐 | 정규형에 가까워짐 |
| 퍼짐의 정보 | 수렴한다는 방향 | SE=σ/√n |
| 통계적 역할 | 평균의 안정성 | 확률·신뢰구간·검정 근거 |
한 문장으로
n이 커지면 평균은 μ 근처로 모이고(큰 수의 법칙), 그 남은 흔들림은 정규분포로 설명할 수 있습니다(중심극한정리).
베르누이 자료에서 표본크기와 성공확률을 바꾸며 표본비율의 표준오차와 95% 범위를 확인하세요.
큰 수의 법칙·중심극한정리 인터랙티브 랩
확률을 정한 뒤 시행을 반복해 이론확률과 실제 상대빈도가 가까워지는 과정을 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
계산 결과
SE=0.050 · 약 40.2~59.8%
np=50.0, n(1−p)=50.0로 정규근사는 대체로 안정적입니다.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
| 주제 | 핵심 내용 |
|---|---|
| 약한·강한 큰 수의 법칙 | 수렴확률과 거의 확실한 수렴처럼 수렴을 정의하는 강도에 따라 정리를 구분합니다. |
| Berry–Esseen 정리 | 유한한 n에서 중심극한정리의 정규근사 오차가 얼마나 큰지 상한을 제공합니다. |
| 델타 방법 | 표본평균의 함수 g(X̄)도 큰 표본에서 근사정규분포를 갖도록 확장합니다. |
| 부트스트랩 | 이론적 표본분포가 복잡할 때 관측표본을 재추출해 통계량의 표본분포를 근사합니다. |