표본평균과 표본분산의 불확실성을 추론에 연결하기
모집단 표준편차를 모르는 상태에서 평균을 검정하거나 여러 집단의 분산을 비교하려면 정규분포만으로는 부족합니다.
t·카이제곱·F 분포는 서로 떨어진 공식이 아니라 정규표본에서 평균과 분산을 추정할 때 자연스럽게 나타나는 한 가족입니다.
어떤 통계량을 만드는지에 따라 분포가 달라집니다. 표준화한 평균은 t, 제곱한 표준정규변수의 합은 카이제곱, 두 카이제곱 비율은 F 분포를 만듭니다.
이번 수업의 지도
평균의 불확실성은 t, 분산 자체는 χ², 분산의 비율은 F 분포로 연결됩니다.
모분산을 추정할 때 정규분포보다 꼬리가 두꺼워집니다.
0 이상에서 비대칭이며 분산·적합도 검정에 사용됩니다.
두 양의 분산 추정량의 비로 ANOVA와 모형 비교에 사용됩니다.
자유도 df는 제약조건을 지킨 뒤 독립적으로 움직일 수 있는 정보의 수입니다. 표본평균을 이미 사용했다면 n개 편차의 합이 0이어야 하므로 마지막 편차는 자유롭게 정할 수 없습니다.
그래서 표본분산은 n이 아니라 n−1로 나눕니다. 자유도가 커질수록 표본에서 추정한 불확실성이 줄고 세 분포의 모양도 안정됩니다.
모집단 표준편차 σ를 모르기 때문에 표본표준편차 s로 대신 표준화하면 통계량은 표준정규분포보다 꼬리가 두꺼운 t 분포를 따릅니다.
작은 표본에서는 s 자체도 크게 흔들리므로 극단적인 t값이 정규분포보다 더 자주 나타납니다.
자유도가 작으면 꼬리가 두껍고 같은 95% 신뢰수준에서도 임계값이 큽니다. 이는 작은 표본의 추가 불확실성을 더 넓은 신뢰구간으로 반영합니다.
df가 커지면 s가 σ를 안정적으로 추정하여 t 분포는 표준정규분포에 가까워집니다.
| 분포 | 양측 95% 임계값 | 의미 |
|---|---|---|
| t, df=5 | 약 ±2.571 | 작은 표본, 넓은 구간 |
| t, df=30 | 약 ±2.042 | 정규분포에 가까워짐 |
| 표준정규 z | ±1.960 | σ를 알거나 큰 표본 |
서로 독립인 표준정규변수 Z₁,…,Zₖ의 제곱합은 자유도 k인 카이제곱분포를 따릅니다.
값이 0보다 작을 수 없고 오른쪽 꼬리가 깁니다. 자유도가 커질수록 중심이 오른쪽으로 이동하고 상대적 비대칭은 줄어듭니다.
정규모집단에서 표본분산 s²을 모집단분산 σ²과 비교한 (n−1)s²/σ²은 자유도 n−1인 카이제곱분포를 따릅니다.
이 관계로 모집단분산의 신뢰구간과 가설검정을 만들 수 있습니다. 평균 추론과 달리 신뢰구간이 좌우대칭이 아닌 이유는 카이제곱분포가 비대칭이기 때문입니다.
독립인 두 카이제곱변수를 각각 자유도로 나눈 뒤 비율을 만들면 F 분포가 됩니다.
F값은 0 이상이고 오른쪽 꼬리가 깁니다. 분자 자유도 df₁과 분모 자유도 df₂ 두 개가 분포 모양을 결정합니다.
영가설에서 집단평균이 모두 같다면 집단 간 변동과 집단 내 변동은 같은 오차분산을 추정하므로 F는 대체로 1 주변입니다.
집단평균 차이가 커지면 집단 간 평균제곱이 커져 F가 1보다 훨씬 커지고 오른쪽 꼬리확률인 p값이 작아집니다.
자유도 1인 분자에 대해 t²은 F(1,df)와 같습니다. 즉 두 집단 평균을 비교하는 t 검정과 같은 문제의 ANOVA F 검정은 동일한 p값을 냅니다.
| 분포 | 통계량의 구조 | 대표 용도 | 모양 |
|---|---|---|---|
| t | 표준화한 평균 | 평균 검정·신뢰구간 | 대칭, 두꺼운 꼬리 |
| χ² | 표준정규 제곱합 | 분산·적합도·독립성 | 0 이상, 오른쪽 꼬리 |
| F | 두 분산 추정량의 비율 | ANOVA·회귀 전체 검정 | 0 이상, 오른쪽 꼬리 |
t 기반 추론은 독립성, 적절한 표본설계, 작은 표본에서의 정규성을 확인해야 합니다. 대응표본과 독립표본은 자유도와 표준오차 구조가 다릅니다.
고전적 분산비 F 검정과 표본분산의 χ² 검정은 비정규성에 민감합니다. 등분산성은 Levene·Brown–Forsythe 검정처럼 더 강건한 방법을 고려할 수 있습니다.
통계량 이름보다 설계를 먼저 보세요
같은 t나 F라도 독립표본, 대응표본, 회귀, ANOVA에 따라 분모의 오차와 자유도가 달라집니다.
표본크기와 표본표준편차를 바꾸며 같은 평균차의 t 통계량이 어떻게 달라지는지 확인하세요.
t·카이제곱·F 분포 인터랙티브 랩
중심과 산포를 조절하며 분포의 위치·폭·꼬리와 요약값이 어떻게 달라지는지 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
계산 결과
t=2.00, df=24
평균차를 4로 고정하면 SE=2.00입니다. n이 커지거나 s가 작아질수록 |t|가 커집니다.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
| 주제 | 핵심 내용 |
|---|---|
| 비중심 t·F 분포 | 영가설이 거짓일 때의 통계량 분포로, 검정력과 표본크기 계산에 사용합니다. |
| Welch 근사 자유도 | 두 집단 분산이 다를 때 표준오차와 자유도를 조정하여 평균을 비교합니다. |
| 우도비와 χ² | 큰 표본에서 여러 우도비 통계량이 카이제곱분포로 근사되는 Wilks 정리가 있습니다. |
| 다음 학습 | 표준화는 서로 다른 단위의 값을 같은 z 척도로 바꾸고 정규분포 확률 계산을 단순화합니다. |