배우기
인터랙티브·

t·카이제곱·F 분포

표본평균과 표본분산의 불확실성을 추론에 연결하기

1

들어가며

모집단 표준편차를 모르는 상태에서 평균을 검정하거나 여러 집단의 분산을 비교하려면 정규분포만으로는 부족합니다.

t·카이제곱·F 분포는 서로 떨어진 공식이 아니라 정규표본에서 평균과 분산을 추정할 때 자연스럽게 나타나는 한 가족입니다.

어떤 통계량을 만드는지에 따라 분포가 달라집니다. 표준화한 평균은 t, 제곱한 표준정규변수의 합은 카이제곱, 두 카이제곱 비율은 F 분포를 만듭니다.

이번 수업의 지도

평균의 불확실성은 t, 분산 자체는 χ², 분산의 비율은 F 분포로 연결됩니다.

t 분포

평균 추론

모분산을 추정할 때 정규분포보다 꼬리가 두꺼워집니다.

카이제곱 분포

제곱합

0 이상에서 비대칭이며 분산·적합도 검정에 사용됩니다.

F 분포

분산비

두 양의 분산 추정량의 비로 ANOVA와 모형 비교에 사용됩니다.

2

자유도는 무엇인가

자유도 df는 제약조건을 지킨 뒤 독립적으로 움직일 수 있는 정보의 수입니다. 표본평균을 이미 사용했다면 n개 편차의 합이 0이어야 하므로 마지막 편차는 자유롭게 정할 수 없습니다.

그래서 표본분산은 n이 아니라 n−1로 나눕니다. 자유도가 커질수록 표본에서 추정한 불확실성이 줄고 세 분포의 모양도 안정됩니다.

df=n추정한 독립 제약의 수df = n - \text{추정한 독립 제약의 수}
한 표본 평균을 추정한 표본분산의 자유도는 n−1입니다.
3

t 분포

모집단 표준편차 σ를 모르기 때문에 표본표준편차 s로 대신 표준화하면 통계량은 표준정규분포보다 꼬리가 두꺼운 t 분포를 따릅니다.

작은 표본에서는 s 자체도 크게 흔들리므로 극단적인 t값이 정규분포보다 더 자주 나타납니다.

t=(xˉμ0)/(s/n),df=n1t = (\bar{x}-\mu _{0})/(s/\sqrt{n}), df=n-1
정규모집단의 한 표본 평균 검정과 신뢰구간에서 사용합니다.
4

자유도와 t 분포의 꼬리

자유도가 작으면 꼬리가 두껍고 같은 95% 신뢰수준에서도 임계값이 큽니다. 이는 작은 표본의 추가 불확실성을 더 넓은 신뢰구간으로 반영합니다.

df가 커지면 s가 σ를 안정적으로 추정하여 t 분포는 표준정규분포에 가까워집니다.

분포양측 95% 임계값의미
t, df=5약 ±2.571작은 표본, 넓은 구간
t, df=30약 ±2.042정규분포에 가까워짐
표준정규 z±1.960σ를 알거나 큰 표본
5

카이제곱 분포

서로 독립인 표준정규변수 Z₁,…,Zₖ의 제곱합은 자유도 k인 카이제곱분포를 따릅니다.

값이 0보다 작을 수 없고 오른쪽 꼬리가 깁니다. 자유도가 커질수록 중심이 오른쪽으로 이동하고 상대적 비대칭은 줄어듭니다.

χ2=Zi2,E(χ2)=df,Var(χ2)=2df\chi ^{2} = \sum Z_{i}^{2}, E(\chi ^{2})=df, \operatorname{Var}(\chi ^{2})=2df
정규모집단 표본분산의 추론과 범주형 독립성 검정에 사용합니다.
6

표본분산과 카이제곱

정규모집단에서 표본분산 s²을 모집단분산 σ²과 비교한 (n−1)s²/σ²은 자유도 n−1인 카이제곱분포를 따릅니다.

이 관계로 모집단분산의 신뢰구간과 가설검정을 만들 수 있습니다. 평균 추론과 달리 신뢰구간이 좌우대칭이 아닌 이유는 카이제곱분포가 비대칭이기 때문입니다.

(n1)s2/σ2 χ2(n1)(n-1)s^{2}/\sigma ^{2} ~ \chi ^{2}(n-1)
모집단이 정규분포라는 가정에 특히 민감합니다.
7

F 분포

독립인 두 카이제곱변수를 각각 자유도로 나눈 뒤 비율을 만들면 F 분포가 됩니다.

F값은 0 이상이고 오른쪽 꼬리가 깁니다. 분자 자유도 df₁과 분모 자유도 df₂ 두 개가 분포 모양을 결정합니다.

F=(U1/df1)/(U2/df2)F = (U_{1}/df_{1})/(U_{2}/df_{2})
두 분산의 비율과 ANOVA의 집단 간 분산/집단 내 분산 비율에 사용합니다.
8

ANOVA에서 F값의 의미

영가설에서 집단평균이 모두 같다면 집단 간 변동과 집단 내 변동은 같은 오차분산을 추정하므로 F는 대체로 1 주변입니다.

집단평균 차이가 커지면 집단 간 평균제곱이 커져 F가 1보다 훨씬 커지고 오른쪽 꼬리확률인 p값이 작아집니다.

F=집단 간 평균제곱MSB/집단 내 평균제곱MSWF = \text{집단 간 평균제곱} MSB / \text{집단 내 평균제곱} MSW
큰 F는 신호가 잡음에 비해 크다는 증거입니다.
9

세 분포의 연결 관계

자유도 1인 분자에 대해 t²은 F(1,df)와 같습니다. 즉 두 집단 평균을 비교하는 t 검정과 같은 문제의 ANOVA F 검정은 동일한 p값을 냅니다.

분포통계량의 구조대표 용도모양
t표준화한 평균평균 검정·신뢰구간대칭, 두꺼운 꼬리
χ²표준정규 제곱합분산·적합도·독립성0 이상, 오른쪽 꼬리
F두 분산 추정량의 비율ANOVA·회귀 전체 검정0 이상, 오른쪽 꼬리
10

사용할 때 주의할 점

t 기반 추론은 독립성, 적절한 표본설계, 작은 표본에서의 정규성을 확인해야 합니다. 대응표본과 독립표본은 자유도와 표준오차 구조가 다릅니다.

고전적 분산비 F 검정과 표본분산의 χ² 검정은 비정규성에 민감합니다. 등분산성은 Levene·Brown–Forsythe 검정처럼 더 강건한 방법을 고려할 수 있습니다.

통계량 이름보다 설계를 먼저 보세요

같은 t나 F라도 독립표본, 대응표본, 회귀, ANOVA에 따라 분모의 오차와 자유도가 달라집니다.

11

직접 해보기

표본크기와 표본표준편차를 바꾸며 같은 평균차의 t 통계량이 어떻게 달라지는지 확인하세요.

t·카이제곱·F 분포 인터랙티브 랩

중심과 산포를 조절하며 분포의 위치·폭·꼬리와 요약값이 어떻게 달라지는지 확인하세요.

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

계산 결과

t=2.00, df=24

평균차를 4로 고정하면 SE=2.00입니다. n이 커지거나 s가 작아질수록 |t|가 커집니다.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

12

핵심 정리

  • t 분포는 모집단 표준편차를 표본으로 추정한 평균 추론에 사용합니다.
  • 카이제곱분포는 표준정규변수의 제곱합이며 분산과 범주형 검정에 나타납니다.
  • F 분포는 두 분산 추정량의 비율이며 ANOVA와 회귀 전체 검정에 사용합니다.
  • 자유도는 독립적으로 남은 정보량이며 분포의 모양과 임계값을 결정합니다.
  • t²=F(1,df)처럼 세 분포는 정규표본 이론 안에서 서로 연결됩니다.
13

더 깊이 알아보기

주제핵심 내용
비중심 t·F 분포영가설이 거짓일 때의 통계량 분포로, 검정력과 표본크기 계산에 사용합니다.
Welch 근사 자유도두 집단 분산이 다를 때 표준오차와 자유도를 조정하여 평균을 비교합니다.
우도비와 χ²큰 표본에서 여러 우도비 통계량이 카이제곱분포로 근사되는 Wilks 정리가 있습니다.
다음 학습표준화는 서로 다른 단위의 값을 같은 z 척도로 바꾸고 정규분포 확률 계산을 단순화합니다.
다음: 표준화(z점수)·정규분포 확률