성공 여부, 성공 횟수, 사건 발생 건수를 모델링하기
클릭했는가, 20명 중 몇 명이 구매했는가, 한 시간에 문의가 몇 건 왔는가는 서로 다른 확률모형이 필요합니다.
베르누이는 한 번의 성공·실패, 이항은 여러 번의 독립 시행에서 성공 횟수, 포아송은 일정 시간이나 공간에서 발생한 사건 수를 다룹니다.
세 분포는 모두 0, 1, 2처럼 셀 수 있는 값을 갖는 이산확률분포지만, 자료가 생성되는 방식과 가정이 다릅니다.
먼저 물을 것
한 번의 결과인가, 고정된 시행 수의 성공 횟수인가, 노출 구간의 발생 건수인가?
성공과 실패 두 결과를 가진 한 번의 시행을 나타냅니다.
독립 시행 n번에서 성공한 횟수의 분포를 계산합니다.
일정한 구간에서 드문 사건이 발생한 횟수를 모델링합니다.
베르누이 확률변수 X는 성공이면 1, 실패이면 0을 갖고 성공확률은 p입니다.
예시는 광고 클릭 여부, 제품 불량 여부, 환자의 치료 반응 여부입니다. 하나의 시행만 설명한다는 점이 핵심입니다.
| X | 의미 | 확률 |
|---|---|---|
| 1 | 성공 | p |
| 0 | 실패 | 1−p |
서로 독립이고 성공확률이 같은 베르누이 시행을 n번 반복했을 때 성공 횟수 X는 이항분포 Bin(n,p)를 따릅니다.
정확히 x번 성공할 확률은 성공할 위치를 고르는 경우의 수와 각 배열의 확률을 곱해 계산합니다.
복원하지 않고 작은 모집단에서 표본을 뽑으면 시행이 독립도 아니고 성공확률도 일정하지 않을 수 있습니다. 이때는 초기하분포가 더 적절할 수 있습니다.
| 조건 | 확인 질문 |
|---|---|
| 고정된 시행 수 | n이 관측 전에 정해져 있는가? |
| 두 가지 결과 | 각 시행을 성공/실패로 구분할 수 있는가? |
| 같은 성공확률 | 모든 시행에서 p가 동일한가? |
| 시행의 독립성 | 한 시행의 결과가 다음 시행에 영향을 주지 않는가? |
자료가 0과 1이면 무조건 이항?
개별 관측은 베르누이지만 집단마다 성공확률이 다르거나 관측끼리 의존하면 단순 이항모형의 분산이 맞지 않을 수 있습니다.
구매확률이 0.2인 방문자 5명 중 정확히 2명이 구매할 확률은?
C(5,2)=10이고, 특정 두 명만 구매할 확률은 0.2²×0.8³입니다.
따라서 P(X=2)=10×0.2²×0.8³=0.2048, 약 20.48%입니다.
포아송분포는 일정한 시간·면적·거리 같은 노출 구간에서 사건이 몇 번 발생하는지 모델링합니다.
λ는 해당 구간의 평균 발생 건수입니다. 분포의 평균과 분산이 모두 λ라는 특징이 있습니다.
고객 문의가 시간당 평균 3건이라면 한 시간 동안 문의가 하나도 없을 확률은?
λ=3, x=0을 대입하면 P(X=0)=e⁻³×3⁰/0!=e⁻³≈0.0498입니다.
적어도 한 건이 올 확률은 여사건을 이용해 1−P(X=0)≈0.9502입니다.
시간당 평균이 3건이면 30분의 평균은 1.5건, 두 시간의 평균은 6건입니다. 발생률 r과 노출량 t를 구분하면 λ=rt입니다.
지역별 사고 건수를 비교할 때 인구나 운행거리 같은 노출량이 다르면 원시 건수만 비교해서는 안 됩니다.
과산포가 크면 음이항분포, 0이 지나치게 많으면 영과잉 모형을 고려할 수 있습니다. 분포 선택은 이름이 아니라 생성 과정과 진단으로 결정합니다.
| 가정 | 어긋나는 사례 |
|---|---|
| 구간 내 발생률이 일정 | 출퇴근 시간에 사고율이 급변 |
| 서로 독립적으로 발생 | 한 고장이 연쇄 고장을 유발 |
| 아주 짧은 구간에 중복 발생이 드묾 | 사건이 묶음으로 몰려 발생 |
| 평균과 분산이 비슷 | 분산이 평균보다 훨씬 큰 과산포 |
n이 크고 p가 작으며 λ=np가 적당한 크기일 때 Bin(n,p)는 Pois(λ)로 근사할 수 있습니다.
많은 기회 중 드문 사건의 횟수라는 생성 구조가 포아송 모형과 닮기 때문입니다. 근사는 계산을 단순하게 하지만 정확도는 n과 p에 따라 달라집니다.
근사 전 확인
근사 공식을 기계적으로 적용하지 말고 실제 이항확률과 오차가 목적에 허용되는지 확인하세요.
n과 p를 바꾸며 이항분포의 중심·퍼짐과 포아송 근사 매개변수를 확인해 보세요.
이산분포: 베르누이·이항·포아송 인터랙티브 랩
확률을 정한 뒤 시행을 반복해 이론확률과 실제 상대빈도가 가까워지는 과정을 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
계산 결과
이항 평균 5.00, 표준편차 2.12
포아송 근사의 λ=np=5.00. 현재 조건은 희귀사건 근사를 검토하기 좋습니다.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
| 주제 | 핵심 내용 |
|---|---|
| 다항분포 | 각 시행의 결과가 성공·실패 두 범주보다 많다면 이항분포를 여러 범주로 확장한 다항분포를 사용할 수 있습니다. |
| 음이항분포 | 포아송 자료에서 관측 분산이 평균보다 큰 과산포가 나타날 때 자주 사용합니다. 개체별 발생률 차이까지 흡수할 수 있습니다. |
| 다음 학습 | 연속분포에서는 가능한 값을 하나씩 더하는 대신 밀도곡선 아래의 면적으로 확률을 계산합니다. |