0과 1로 관측되는 결과의 발생확률을 S자 곡선으로 설명합니다.
이탈은 0 또는 1인데 평균을 어떻게 회귀할까?
고객 한 명은 이탈하거나 이탈하지 않습니다. 하지만 같은 특성을 가진 고객집단의 0/1 평균은 이탈확률입니다.
로지스틱과 프로빗 회귀는 X의 선형결합을 0~1의 확률로 변환해, 어떤 조건에서 사건이 발생할 가능성이 달라지는지 추정합니다.
핵심 질문
X가 달라질 때 사건의 확률은 어느 방향으로 얼마나 달라질까요?
예측변수의 가중합으로 사건 발생 경향을 계산합니다.
로짓 또는 프로빗 연결함수가 점수를 확률로 바꿉니다.
계수의 지수값과 확률 변화는 기준 확률에 따라 다르게 읽습니다.
확률 범위와 분산 구조가 맞지 않습니다
0/1을 OLS로 회귀한 선형확률모형은 0 미만·1 초과를 예측할 수 있고 오차분산 p(1−p)가 확률에 따라 달라집니다.
| 문제 | 선형확률모형 | 로짓·프로빗 |
|---|---|---|
| 예측범위 | 제한 없음 | 0~1 |
| 관계형태 | 항상 직선 | S자 |
| 분산 | 이분산 | 이항분포에 반영 |
| 해석 | 확률의 가산 변화 | 오즈·잠재지수 후 확률 변환 |
로지스틱 계수는 확률이 아니라 로그오즈를 움직입니다
확률 p의 오즈는 p/(1−p), 로그오즈는 log[p/(1−p)]입니다. 로짓 모형은 로그오즈를 X의 선형식으로 만듭니다.
| 확률 p | 오즈 | 뜻 |
|---|---|---|
| .20 | .25 | 실패 4번당 성공 1번 |
| .50 | 1 | 성공과 실패가 같음 |
| .80 | 4 | 실패 1번당 성공 4번 |
로짓식
logit(p)=−2+0.7X이면 X 1단위 증가할 때 로그오즈는 .7, 오즈는 e^.7≈2.01배가 됩니다.
링크함수의 꼬리 모양과 계수 척도가 다릅니다
로지스틱은 logistic CDF, 프로빗은 표준정규 CDF Φ를 역링크로 사용합니다. 중앙부 예측은 대개 비슷하지만 계수 크기는 척도가 달라 직접 비교할 수 없습니다.
| 항목 | 로지스틱 | 프로빗 |
|---|---|---|
| 링크 | logit | Φ⁻¹ |
| 계수 해석 | e^β로 오즈비 | 잠재 z지수 변화 |
| 꼬리 | 조금 두꺼움 | 정규 꼬리 |
| 선호 상황 | 해석·실무 보고 | 잠재변수 이론·계량모형 |
우열보다 목적
대부분의 자료에서 예측은 유사합니다. 오즈비 해석이 중요하면 로짓, 정규 잠재오차 가정이 자연스러우면 프로빗을 고려합니다.
오즈비는 확률비나 확률차가 아닙니다
로지스틱에서 e^β는 다른 변수가 같을 때 X 1단위당 오즈의 배수입니다. 기준확률에 따라 같은 오즈비가 만드는 확률차는 달라집니다.
| 기준확률 | OR=2 적용 후 확률 | 확률차 |
|---|---|---|
| .10 | .182 | +.082 |
| .50 | .667 | +.167 |
| .80 | .889 | +.089 |
확률로도 보고합니다
오즈비와 함께 대표적인 X값의 예측확률 또는 평균한계효과를 제시하면 실제 의미가 명확해집니다.
X 변화가 예측확률을 얼마나 바꾸는지 결과척도로 표현합니다
연속 X의 순간 한계효과는 로짓에서 βp(1−p)이며 사람마다 p가 달라 값도 달라집니다. 범주형 X는 0에서 1로 바꾼 예측확률 차이를 계산합니다.
| 방식 | 계산 | 용도 |
|---|---|---|
| 대표값 한계효과 | 평균 X에서 계산 | 대표 사례 |
| 평균한계효과 AME | 개인별 효과를 평균 | 표본 전체 요약 |
| 이산변화 | X=0과 1 예측차 | 더미변수 |
| 예측확률 | 조건 조합별 p | 의사결정·시각화 |
적합·구분·보정·임계값을 구분합니다
AUC는 양성과 음성의 순위를 얼마나 잘 구분하는지, calibration은 예측확률이 실제 빈도와 맞는지 봅니다. 정확도는 임계값과 클래스 비율에 크게 의존합니다.
| 지표 | 질문 |
|---|---|
| 로그손실·deviance | 확률예측 전체가 얼마나 좋은가? |
| AUC | 양성을 음성보다 높게 순위화하는가? |
| Calibration plot·Brier | 예측 20%가 실제 약 20%인가? |
| 민감도·특이도 | 정한 임계값에서 오류가 어떤가? |
사건 정의부터 확률 검증까지
양성 범주와 관측시점을 명확히 정하고 데이터 누출을 차단합니다. 비선형성과 상호작용을 검토하고 적합 후 계수·확률·성능·보정을 확인합니다.
| 단계 | 하는 일 |
|---|---|
| 1 | 사건=1과 예측시점 정의 |
| 2 | 누출·결측·클래스 불균형 확인 |
| 3 | 로짓 또는 프로빗 적합 |
| 4 | OR·예측확률·AME 계산 |
| 5 | AUC·로그손실·calibration 평가 |
| 6 | 목적 비용으로 임계값 선택 |
계약기간과 문의횟수로 고객 이탈을 설명합니다
고객 1,500명의 다음 달 이탈을 로지스틱 회귀로 분석했습니다. 계약기간 계수 −.08, 문의횟수 계수 .35였습니다.
| 변수 | β | OR | 해석 |
|---|---|---|---|
| 계약기간 1개월 | −.08 | .923 | 이탈 오즈 약 7.7% 감소 |
| 문의 1회 | .35 | 1.42 | 이탈 오즈 42% 증가 |
| AUC | — | .78 | 순위 구분력 |
| Brier | — | .14 | 확률오차 |
결과 해석
다른 변수가 같을 때 문의 1회 증가는 이탈 오즈 1.42배와 관련됐습니다. 평균 고객에서 예측확률은 문의 1회 증가 시 18%에서 24%로 6%p 상승했습니다.
분리·희귀사건·오즈비 과장을 확인합니다
어떤 변수 조합이 결과를 완벽히 분리하면 최대우도 계수가 발산할 수 있습니다. 희귀사건에서 오즈비는 위험비와 비슷하지만 사건이 흔하면 차이가 큽니다.
| 문제 | 대응 |
|---|---|
| 완전분리 | Firth·베이지안·정규화 |
| 희귀사건 | 표본설계·보정·PR 곡선 |
| 비선형 logit | 스플라인·변환 |
| 반복자료 | GEE·혼합로짓 |
| 임계값 .5 고정 | 비용·유병률에 맞춰 선택 |
계수와 X가 S자 확률곡선을 어떻게 움직이는지 봅니다
β와 X를 바꿔보세요. 같은 β라도 p가 .5 근처일 때 확률 변화가 크고 0이나 1 근처에서는 작아집니다.
로지스틱·프로빗 회귀 인터랙티브 랩
임계값을 움직이며 거짓 양성과 거짓 음성이 서로 교환되는 과정을 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
p=1/(1+e⁻η)
확률 37.8%
η=−0.5+0.0×0.0=-0.50
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
로지스틱·프로빗의 판단 규칙
요약은 아래 핵심 정리에서 확인합니다.
이분형 회귀의 확장을 살펴봅니다
다음 연결
결과가 0/1이 아니라 0,1,2…의 발생 건수라면 포아송·음이항 카운트 회귀를 사용합니다.
| 주제 | 핵심 내용 |
|---|---|
| Firth logistic | 분리와 작은 표본 편향 완화 |
| Rare-events logistic | 희귀 양성의 편향 보정 |
| Multinomial logit | 순서 없는 다범주 결과 |
| Ordinal logit | 순서형 결과와 비례오즈 |
| Mixed logistic | 군집별 임의효과 포함 |