배우기
인터랙티브·

산포: 범위·분산·표준편차

중심 주변의 흔들림과 값 사이의 차이를 원단위와 제곱단위로 측정하기

1

들어가며

두 반의 평균이 모두 70점이어도 한 반은 68~72점, 다른 반은 20~100점일 수 있습니다.

대푯값 하나는 일관성·개인차·위험을 보여주지 못합니다. 산포는 값들이 중심에서 얼마나 떨어져 있고 서로 얼마나 다른지를 요약합니다.

산포가 작다고 좋은 것도, 크다고 나쁜 것도 아닙니다. 제조오차에서는 작을수록 좋지만 투자수익·환자반응에서는 위험과 이질성을 함께 뜻합니다.

핵심 질문

값들은 중심 주변에 얼마나 모여 있으며 한 관측을 전형적이라고 믿을 수 있는가?

범위

전체 폭

최댓값과 최솟값의 차이로 자료의 전체 폭을 봅니다.

분산

제곱 단위

평균에서 떨어진 거리를 제곱해 평균낸 값입니다.

표준편차

원래 단위

분산의 제곱근으로 전형적인 흔들림을 원단위로 나타냅니다.

2

범위는 전체 폭이다

범위는 최댓값−최솟값으로 계산이 쉽고 단위가 원자료와 같습니다. 하지만 두 값만 사용해 관측 하나의 오류와 표본크기에 매우 민감합니다.

같은 분포에서도 표본이 커질수록 더 극단적인 값을 만날 가능성이 높아 범위가 커집니다. 표본 크기가 다른 집단의 범위만 직접 비교하지 않습니다.

Range=max(x)min(x)Range=\operatorname{max}(x)-\operatorname{min}(x)
빠른 품질점검에는 유용하지만 전형적인 산포를 대표하지 못할 수 있습니다.
3

편차와 상쇄 문제

편차 d_i=x_i−x̄는 각 값이 평균보다 얼마나 위·아래인지 나타냅니다. 자료 2,4,4,5,10의 평균 5에서 편차는 −3,−1,−1,0,5입니다.

편차합은 항상 0이므로 그대로 평균내면 산포가 사라집니다. 절댓값을 취하거나 제곱해 양수로 만든 뒤 요약해야 합니다.

4

분산을 직접 계산하기

편차를 제곱하면 9,1,1,0,25이고 합은 36입니다. 이 자료를 모집단 전체로 보면 분산은 36/5=7.2, 표준편차는 √7.2≈2.68입니다.

제곱은 큰 편차를 더 크게 반영하고 미분·분해가 쉬워 통계모형에 널리 사용됩니다. 대신 분산 단위는 점수²·원²처럼 원자료와 다릅니다.

σ2=(1/N)i(xiμ)2,σ=σ2\sigma ^{2}=(1/N)\sum _{i}(x_{i}-\mu )^{2}, \sigma =√\sigma ^{2}
모집단 전체를 기술할 때 N으로 나눕니다.
5

표본분산은 왜 n−1인가

표본에서 같은 자료로 평균을 추정하면 편차가 평균 주변에 강제로 모여 모집단 분산을 작게 추정합니다. 자유도 하나를 잃으므로 n이 아닌 n−1로 나눠 편향을 보정합니다.

n−1은 표본분산 s²가 모집단분산 σ²의 불편추정량이 되게 합니다. 표본 SD s 자체가 완전히 불편한 것은 아니며 기술 목적과 소프트웨어 정의를 확인합니다.

s2=[i(xixˉ)2]/(n1)s^{2}=[\sum _{i}(x_{i}-\bar{x})^{2}]/(n-1)
편차 n개 중 마지막 하나는 합이 0이라는 제약으로 이미 결정됩니다.
6

표준편차를 해석하는 법

SD는 값과 같은 단위로 “평균에서 전형적으로 떨어진 규모”를 나타내지만 평균절대거리 그 자체는 아닙니다. 모든 값을 동일하게 k배 하면 SD도 |k|배 됩니다.

정규분포에서는 평균±1SD에 약 68%, ±2SD에 약 95%가 있지만 모든 분포에 적용되는 규칙은 아닙니다. 비대칭·다봉·두꺼운 꼬리에서는 그래프를 함께 봅니다.

7

IQR과 MAD

IQR=Q3−Q1은 가운데 50%의 폭이라 양끝 극단값에 강건합니다. 중앙절대편차 MAD=median(|x−median(x)|)도 강건한 산포입니다.

비대칭자료에는 중앙값과 IQR, 대칭자료에는 평균과 SD를 짝지어 보고합니다. IQR은 표본의 절반만 요약하므로 꼬리위험은 별도 분위수로 보여줍니다.

IQR=Q3Q1,MAD=median(ximedian(x))IQR=Q_{3}-Q_{1}, MAD=\operatorname{median}(|x_{i}-\operatorname{median}(x)|)
정규분포와 비교할 때 scaled MAD≈1.4826×MAD를 사용하기도 합니다.
8

이상치가 산포에 미치는 영향

2,4,4,5,10에서 10을 100으로 바꾸면 평균뿐 아니라 제곱편차가 크게 증가해 SD가 폭발합니다. 범위와 SD는 민감하고 IQR·MAD는 상대적으로 안정적입니다.

민감함은 결함만은 아닙니다. 극단손실이 중요한 금융·안전 문제에서는 SD와 꼬리분위수가 위험을 드러냅니다. 오류 제거와 실제 위험 은폐를 구분합니다.

9

변동계수로 단위가 다른 산포 비교

CV=SD/평균은 평균 대비 상대적 산포를 나타내 단위나 수준이 다른 양의 ratio 자료를 비교합니다. 평균 100, SD 10과 평균 20, SD 4의 CV는 각각 10%,20%입니다.

평균이 0에 가깝거나 음수이면 CV가 폭발하거나 해석이 뒤집힙니다. 온도처럼 임의적 0을 가진 interval 척도에도 부적절합니다.

CV=s/xˉ×100%CV=s/\bar{x}\times 100\%
의미 있는 절대 0과 양의 평균이 있는 자료에서 사용합니다.
10

분산의 결합과 분해

전체 변동은 집단 내부 변동과 집단평균 사이 변동으로 나눌 수 있습니다. 각 집단 SD의 단순평균은 전체 SD가 아닙니다.

독립변수 X,Y의 합은 Var(X+Y)=Var(X)+Var(Y)이지만 상관이 있으면 2Cov(X,Y)가 추가됩니다. 포트폴리오·측정오차에서 공분산이 중요한 이유입니다.

Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)\operatorname{Var}(X+Y)=\operatorname{Var}(X)+\operatorname{Var}(Y)+2Cov(X,Y)
산포는 각 변수의 변동뿐 아니라 함께 움직이는 정도에도 달려 있습니다.
11

보고와 비교의 원칙

n, 평균·SD 또는 중앙값·IQR, 범위와 그래프를 함께 제시합니다. 반올림은 SD 정밀도와 맞추고 결측·가중치·표본/모집단 분모를 명시합니다.

집단의 평균수준이 다르면 SD 차이가 수준효과인지 상대변동 차이인지 확인합니다. 시간자료는 전체 SD가 추세와 계절성까지 포함하므로 정상 구간의 변동성과 구분합니다.

12

직접 해보기

자료 네 개가 평균에서 같은 거리 a만큼 떨어질 때 SD가 어떻게 변하는지 확인하세요.

산포: 범위·분산·표준편차 인터랙티브 랩

중심과 산포를 조절하며 분포의 위치·폭·꼬리와 요약값이 어떻게 달라지는지 확인하세요.

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

계산 결과

모집단 SD 10.0

자료 [μ−a,μ−a,μ+a,μ+a]의 모집단 SD는 a와 같습니다. 표본 SD는 n−1로 나눠 11.5입니다.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

13

핵심 정리와 더 깊이 알아보기

  • 범위는 전체 폭이지만 두 극단값과 표본크기에 매우 민감합니다.
  • 분산은 제곱편차 평균이고 표준편차는 이를 원자료 단위로 되돌린 값입니다.
  • 표본분산은 평균 추정으로 잃은 자유도를 반영해 n−1로 나눕니다.
  • IQR·MAD는 이상치에 강건하고 CV는 의미 있는 0을 가진 양의 자료의 상대산포를 비교합니다.
  • 산포는 중심·분포모양·표본 수·그래프와 함께 해석해야 합니다.
주제핵심 내용
Chebyshev 부등식분포모양과 무관하게 평균에서 k SD 안에 최소 1−1/k² 비율이 있음을 보장합니다.
분산 안정화평균이 커질수록 분산도 커지는 자료에 로그·제곱근 변환을 사용합니다.
Gini mean difference모든 관측쌍의 절대차 평균으로 산포를 직접적인 값 간 차이로 표현합니다.
다음 학습백분위수와 사분위수는 값의 크기를 전체 분포 안의 상대적 위치로 바꿉니다.
다음: 백분위수·사분위수