확률분포의 중심과 퍼짐을 숫자로 요약하기
결과가 불확실해도, 장기적으로 어느 정도를 기대하고 얼마나 흔들리는지는 계산할 수 있습니다.
기댓값은 가능한 값들의 단순 평균이 아니라 각 값에 그 값이 나타날 확률을 가중치로 준 평균입니다.
분산은 값들이 기댓값에서 얼마나 멀리 흩어져 있는지를 제곱거리로 측정합니다. 같은 기댓값을 가진 선택지라도 분산이 다르면 위험은 전혀 다를 수 있습니다.
이번 수업의 질문
평균 수익이 같아도 어떤 게임이 더 위험한가?
각 값에 확률을 가중해 반복 시행의 평균적 위치를 구합니다.
각 결과가 기댓값에서 얼마나 떨어지는지 측정합니다.
확률을 반영한 제곱편차 평균으로 불확실성의 크기를 나타냅니다.
이산확률변수 X가 x₁, x₂, … 값을 가질 때 E(X)=Σx·P(X=x)입니다.
같은 시행을 매우 많이 반복해 얻은 관측값의 평균은 조건이 맞으면 기댓값에 가까워집니다. 하지만 한 번의 결과가 기댓값과 같다는 뜻은 아닙니다.
동전을 한 번 던져 앞면이면 3점, 뒷면이면 −1점을 받는 게임을 생각해 봅시다.
E(X)=3×0.5+(−1)×0.5=1입니다. 장기 평균 점수는 시행당 1점입니다.
실제 한 번의 결과는 3점 또는 −1점뿐입니다. 1점은 장기 평균을 나타내는 중심이지 반드시 관측 가능한 값은 아닙니다.
| 결과 | X | 확률 | X×확률 |
|---|---|---|---|
| 앞면 | 3 | 0.5 | 1.5 |
| 뒷면 | −1 | 0.5 | −0.5 |
| 합계 | 1.0 | 1.0 |
상수 a, b에 대해 E(aX+b)=aE(X)+b입니다. 또한 두 변수의 독립 여부와 관계없이 E(X+Y)=E(X)+E(Y)입니다.
예를 들어 한 상품의 예상 이익이 2천 원이면 100개 판매의 총 예상 이익은 20만 원입니다. 개별 이익들이 독립이 아니어도 기대 합계 자체는 더할 수 있습니다.
자주 하는 착각
일반적으로 E(g(X))=g(E(X))는 성립하지 않습니다. 특히 E(X²)와 [E(X)]²은 다릅니다.
편차 X−μ를 그대로 평균내면 양수와 음수가 상쇄되어 0이 됩니다. 그래서 편차를 제곱한 뒤 평균냅니다.
모분산은 Var(X)=E[(X−μ)²]이며 μ=E(X)입니다. 계산할 때는 Var(X)=E(X²)−[E(X)]²도 자주 씁니다.
앞의 게임에서 μ=1이었습니다.
Var(X)=4이고 표준편차 SD(X)=√4=2입니다.
분산의 단위는 원래 단위의 제곱이므로 해석이 불편할 수 있습니다. 표준편차는 원래 단위로 돌아와 전형적인 흔들림의 크기를 표현합니다.
| X | 확률 | X−μ | (X−μ)² | 제곱편차×확률 |
|---|---|---|---|---|
| 3 | 0.5 | 2 | 4 | 2 |
| −1 | 0.5 | −2 | 4 | 2 |
| 합계 | 1.0 | 4 |
기댓값이 위치를 요약한다면 분산과 표준편차는 불확실성의 크기를 요약합니다.
두 투자안의 기대수익이 같아도 표준편차가 큰 투자안은 결과의 변동 폭이 큽니다. 다만 분산 하나만으로 꼬리위험이나 비대칭성을 모두 설명할 수는 없습니다.
| 요약량 | 무엇을 측정? | 단위 |
|---|---|---|
| 기댓값 E(X) | 분포의 중심 | X와 동일 |
| 분산 Var(X) | 평균 제곱거리 | X 단위의 제곱 |
| 표준편차 SD(X) | 전형적 거리 | X와 동일 |
모든 값에 b를 더하면 중심만 이동하므로 분산은 변하지 않습니다. 모든 값에 a를 곱하면 편차도 a배가 되어 분산은 a²배가 됩니다.
섭씨 온도를 화씨로 바꾸거나 원화를 천 원 단위로 바꿀 때 이 규칙을 이용할 수 있습니다.
두 변수의 합에 대한 분산은 Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)입니다.
X와 Y가 독립이면 공분산이 0이므로 분산을 단순히 더할 수 있습니다. 그러나 함께 오르내리는 변수라면 공분산 항을 빼먹어서는 안 됩니다.
독립과 무상관
독립이면 공분산은 0이지만, 공분산이 0이라고 반드시 독립인 것은 아닙니다.
기대수익이 높다는 이유만으로 최선의 선택이라고 단정할 수 없습니다. 손실을 감당할 수 있는지, 결과 분포가 비대칭인지, 극단값이 얼마나 가능한지도 함께 봐야 합니다.
보험은 평균적으로 보험료가 기대손실보다 높을 수 있어도 큰 손실의 변동성을 줄이는 가치가 있습니다. 기댓값과 분산은 서로 다른 질문에 답합니다.
보고할 때
E(X)=10만 원, SD(X)=2만 원처럼 중심과 변동성을 같은 단위로 함께 제시하세요.
성공 확률과 성공 보상을 바꾸며 게임의 기댓값과 위험을 비교해 보세요.
기댓값·분산 인터랙티브 랩
중심과 산포를 조절하며 분포의 위치·폭·꼬리와 요약값이 어떻게 달라지는지 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
계산 결과
기댓값 3.00, 표준편차 5.00
성공하면 8, 실패하면 -2. 분산은 25.00입니다.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
| 주제 | 핵심 내용 |
|---|---|
| 조건부 기댓값 | 추가 정보 Y를 알고 난 뒤의 평균 E(X|Y)를 뜻합니다. 전체 기댓값의 법칙 E(X)=E[E(X|Y)]은 복잡한 문제를 집단별로 나누어 계산하게 해 줍니다. |
| 전체분산의 법칙 | Var(X)=E[Var(X|Y)]+Var(E[X|Y])입니다. 전체 변동을 집단 내부 변동과 집단 간 평균의 변동으로 나눕니다. |
| 다음 학습 | 베르누이·이항·포아송 분포에서는 매개변수만 알면 기댓값과 분산을 간단한 공식으로 계산할 수 있습니다. |