배우기
인터랙티브·

이산분포: 베르누이·이항·포아송

성공 여부, 성공 횟수, 사건 발생 건수를 모델링하기

1

들어가며

클릭했는가, 20명 중 몇 명이 구매했는가, 한 시간에 문의가 몇 건 왔는가는 서로 다른 확률모형이 필요합니다.

베르누이는 한 번의 성공·실패, 이항은 여러 번의 독립 시행에서 성공 횟수, 포아송은 일정 시간이나 공간에서 발생한 사건 수를 다룹니다.

세 분포는 모두 0, 1, 2처럼 셀 수 있는 값을 갖는 이산확률분포지만, 자료가 생성되는 방식과 가정이 다릅니다.

먼저 물을 것

한 번의 결과인가, 고정된 시행 수의 성공 횟수인가, 노출 구간의 발생 건수인가?

베르누이

한 번

성공과 실패 두 결과를 가진 한 번의 시행을 나타냅니다.

이항분포

성공 횟수

독립 시행 n번에서 성공한 횟수의 분포를 계산합니다.

포아송분포

사건 개수

일정한 구간에서 드문 사건이 발생한 횟수를 모델링합니다.

2

베르누이 분포

베르누이 확률변수 X는 성공이면 1, 실패이면 0을 갖고 성공확률은 p입니다.

예시는 광고 클릭 여부, 제품 불량 여부, 환자의 치료 반응 여부입니다. 하나의 시행만 설명한다는 점이 핵심입니다.

P(X=x)=px(1p)1x,x{0,1}P(X=x)=p^x(1-p)^{1-x},\quad x\in\{0,1\}
E(X)=p, Var(X)=p(1−p)
X의미확률
1성공p
0실패1−p
3

이항분포

서로 독립이고 성공확률이 같은 베르누이 시행을 n번 반복했을 때 성공 횟수 X는 이항분포 Bin(n,p)를 따릅니다.

정확히 x번 성공할 확률은 성공할 위치를 고르는 경우의 수와 각 배열의 확률을 곱해 계산합니다.

P(X=x)=(nx)px(1p)nxP(X=x)=\binom{n}{x}p^x(1-p)^{n-x}
x=0,1,…,n이며 E(X)=np, Var(X)=np(1−p)
4

이항분포의 네 가지 조건

복원하지 않고 작은 모집단에서 표본을 뽑으면 시행이 독립도 아니고 성공확률도 일정하지 않을 수 있습니다. 이때는 초기하분포가 더 적절할 수 있습니다.

조건확인 질문
고정된 시행 수n이 관측 전에 정해져 있는가?
두 가지 결과각 시행을 성공/실패로 구분할 수 있는가?
같은 성공확률모든 시행에서 p가 동일한가?
시행의 독립성한 시행의 결과가 다음 시행에 영향을 주지 않는가?

자료가 0과 1이면 무조건 이항?

개별 관측은 베르누이지만 집단마다 성공확률이 다르거나 관측끼리 의존하면 단순 이항모형의 분산이 맞지 않을 수 있습니다.

5

이항확률 계산 예제

구매확률이 0.2인 방문자 5명 중 정확히 2명이 구매할 확률은?

C(5,2)=10이고, 특정 두 명만 구매할 확률은 0.2²×0.8³입니다.

따라서 P(X=2)=10×0.2²×0.8³=0.2048, 약 20.48%입니다.

P(X=2)=10×0.04×0.512=0.2048P(X=2) = 10 \times 0.04 \times 0.512 = 0.2048
평균 구매자 수는 np=1명, 분산은 np(1−p)=0.8입니다.
6

포아송 분포

포아송분포는 일정한 시간·면적·거리 같은 노출 구간에서 사건이 몇 번 발생하는지 모델링합니다.

λ는 해당 구간의 평균 발생 건수입니다. 분포의 평균과 분산이 모두 λ라는 특징이 있습니다.

P(X=x)=eλλxx!P(X=x)=\frac{e^{-\lambda}\lambda^x}{x!}
x=0,1,2,…이며 E(X)=Var(X)=λ
7

포아송 예제: 문의 건수

고객 문의가 시간당 평균 3건이라면 한 시간 동안 문의가 하나도 없을 확률은?

λ=3, x=0을 대입하면 P(X=0)=e⁻³×3⁰/0!=e⁻³≈0.0498입니다.

적어도 한 건이 올 확률은 여사건을 이용해 1−P(X=0)≈0.9502입니다.

P(X1)=1e30.9502P(X\ge 1) = 1 - e^{-3} \approx 0.9502
“적어도 하나”는 0건의 여사건으로 계산하면 간단합니다.
8

노출량이 바뀌면 λ도 바뀐다

시간당 평균이 3건이면 30분의 평균은 1.5건, 두 시간의 평균은 6건입니다. 발생률 r과 노출량 t를 구분하면 λ=rt입니다.

지역별 사고 건수를 비교할 때 인구나 운행거리 같은 노출량이 다르면 원시 건수만 비교해서는 안 됩니다.

λ=발생률r×노출량t\lambda = \text{발생률} r \times \text{노출량} t
같은 발생률이어도 관찰 시간이 길수록 기대 건수는 커집니다.
9

포아송분포의 핵심 가정

과산포가 크면 음이항분포, 0이 지나치게 많으면 영과잉 모형을 고려할 수 있습니다. 분포 선택은 이름이 아니라 생성 과정과 진단으로 결정합니다.

가정어긋나는 사례
구간 내 발생률이 일정출퇴근 시간에 사고율이 급변
서로 독립적으로 발생한 고장이 연쇄 고장을 유발
아주 짧은 구간에 중복 발생이 드묾사건이 묶음으로 몰려 발생
평균과 분산이 비슷분산이 평균보다 훨씬 큰 과산포
10

이항과 포아송의 연결

n이 크고 p가 작으며 λ=np가 적당한 크기일 때 Bin(n,p)는 Pois(λ)로 근사할 수 있습니다.

많은 기회 중 드문 사건의 횟수라는 생성 구조가 포아송 모형과 닮기 때문입니다. 근사는 계산을 단순하게 하지만 정확도는 n과 p에 따라 달라집니다.

Bin(n,p)Pois(λ=np)Bin(n,p) \approx Pois(\lambda =np)
흔히 p가 작고 n이 충분히 큰 희귀사건 상황에서 사용합니다.

근사 전 확인

근사 공식을 기계적으로 적용하지 말고 실제 이항확률과 오차가 목적에 허용되는지 확인하세요.

11

직접 해보기

n과 p를 바꾸며 이항분포의 중심·퍼짐과 포아송 근사 매개변수를 확인해 보세요.

이산분포: 베르누이·이항·포아송 인터랙티브 랩

확률을 정한 뒤 시행을 반복해 이론확률과 실제 상대빈도가 가까워지는 과정을 확인하세요.

이론확률관측비율0/34

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

계산 결과

이항 평균 5.00, 표준편차 2.12

포아송 근사의 λ=np=5.00. 현재 조건은 희귀사건 근사를 검토하기 좋습니다.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

12

핵심 정리

  • 베르누이는 한 번의 성공·실패를 p 하나로 모델링합니다.
  • 이항분포는 독립이고 성공확률이 같은 n번의 시행에서 성공 횟수를 다룹니다.
  • Bin(n,p)의 평균은 np, 분산은 np(1−p)입니다.
  • 포아송분포는 노출 구간의 사건 수를 다루며 평균과 분산이 λ입니다.
  • 분포를 고를 때 자료의 값뿐 아니라 시행 구조, 노출량, 독립성, 과산포를 확인합니다.
13

더 깊이 알아보기

주제핵심 내용
다항분포각 시행의 결과가 성공·실패 두 범주보다 많다면 이항분포를 여러 범주로 확장한 다항분포를 사용할 수 있습니다.
음이항분포포아송 자료에서 관측 분산이 평균보다 큰 과산포가 나타날 때 자주 사용합니다. 개체별 발생률 차이까지 흡수할 수 있습니다.
다음 학습연속분포에서는 가능한 값을 하나씩 더하는 대신 밀도곡선 아래의 면적으로 확률을 계산합니다.
다음: 연속분포 — 균등·지수·정규