현재 본문을 보고 있습니다
배우기
인터랙티브·

로지스틱·프로빗 회귀

0과 1로 관측되는 결과의 발생확률을 S자 곡선으로 설명합니다.

1

들어가며

이탈은 0 또는 1인데 평균을 어떻게 회귀할까?

고객 한 명은 이탈하거나 이탈하지 않습니다. 하지만 같은 특성을 가진 고객집단의 0/1 평균은 이탈확률입니다.

로지스틱과 프로빗 회귀는 X의 선형결합을 0~1의 확률로 변환해, 어떤 조건에서 사건이 발생할 가능성이 달라지는지 추정합니다.

핵심 질문

X가 달라질 때 사건의 확률은 어느 방향으로 얼마나 달라질까요?

선형 점수

−∞~∞

예측변수의 가중합으로 사건 발생 경향을 계산합니다.

S자 변환

0~1

로짓 또는 프로빗 연결함수가 점수를 확률로 바꿉니다.

오즈와 한계효과

해석

계수의 지수값과 확률 변화는 기준 확률에 따라 다르게 읽습니다.

2

왜 OLS를 그대로 쓰지 않는가

확률 범위와 분산 구조가 맞지 않습니다

0/1을 OLS로 회귀한 선형확률모형은 0 미만·1 초과를 예측할 수 있고 오차분산 p(1−p)가 확률에 따라 달라집니다.

문제선형확률모형로짓·프로빗
예측범위제한 없음0~1
관계형태항상 직선S자
분산이분산이항분포에 반영
해석확률의 가산 변화오즈·잠재지수 후 확률 변환
3

확률과 오즈는 무엇이 다른가

로지스틱 계수는 확률이 아니라 로그오즈를 움직입니다

확률 p의 오즈는 p/(1−p), 로그오즈는 log[p/(1−p)]입니다. 로짓 모형은 로그오즈를 X의 선형식으로 만듭니다.

확률 p오즈
.20.25실패 4번당 성공 1번
.501성공과 실패가 같음
.804실패 1번당 성공 4번

로짓식

logit(p)=−2+0.7X이면 X 1단위 증가할 때 로그오즈는 .7, 오즈는 e^.7≈2.01배가 됩니다.

4

로지스틱과 프로빗의 차이

링크함수의 꼬리 모양과 계수 척도가 다릅니다

로지스틱은 logistic CDF, 프로빗은 표준정규 CDF Φ를 역링크로 사용합니다. 중앙부 예측은 대개 비슷하지만 계수 크기는 척도가 달라 직접 비교할 수 없습니다.

항목로지스틱프로빗
링크logitΦ⁻¹
계수 해석e^β로 오즈비잠재 z지수 변화
꼬리조금 두꺼움정규 꼬리
선호 상황해석·실무 보고잠재변수 이론·계량모형

우열보다 목적

대부분의 자료에서 예측은 유사합니다. 오즈비 해석이 중요하면 로짓, 정규 잠재오차 가정이 자연스러우면 프로빗을 고려합니다.

5

계수는 어떻게 해석하는가

오즈비는 확률비나 확률차가 아닙니다

로지스틱에서 e^β는 다른 변수가 같을 때 X 1단위당 오즈의 배수입니다. 기준확률에 따라 같은 오즈비가 만드는 확률차는 달라집니다.

기준확률OR=2 적용 후 확률확률차
.10.182+.082
.50.667+.167
.80.889+.089

확률로도 보고합니다

오즈비와 함께 대표적인 X값의 예측확률 또는 평균한계효과를 제시하면 실제 의미가 명확해집니다.

6

한계효과란 무엇인가

X 변화가 예측확률을 얼마나 바꾸는지 결과척도로 표현합니다

연속 X의 순간 한계효과는 로짓에서 βp(1−p)이며 사람마다 p가 달라 값도 달라집니다. 범주형 X는 0에서 1로 바꾼 예측확률 차이를 계산합니다.

방식계산용도
대표값 한계효과평균 X에서 계산대표 사례
평균한계효과 AME개인별 효과를 평균표본 전체 요약
이산변화X=0과 1 예측차더미변수
예측확률조건 조합별 p의사결정·시각화
7

모형 성능은 어떻게 평가하는가

적합·구분·보정·임계값을 구분합니다

AUC는 양성과 음성의 순위를 얼마나 잘 구분하는지, calibration은 예측확률이 실제 빈도와 맞는지 봅니다. 정확도는 임계값과 클래스 비율에 크게 의존합니다.

지표질문
로그손실·deviance확률예측 전체가 얼마나 좋은가?
AUC양성을 음성보다 높게 순위화하는가?
Calibration plot·Brier예측 20%가 실제 약 20%인가?
민감도·특이도정한 임계값에서 오류가 어떤가?
8

분석은 어떻게 이루어지는가

사건 정의부터 확률 검증까지

양성 범주와 관측시점을 명확히 정하고 데이터 누출을 차단합니다. 비선형성과 상호작용을 검토하고 적합 후 계수·확률·성능·보정을 확인합니다.

단계하는 일
1사건=1과 예측시점 정의
2누출·결측·클래스 불균형 확인
3로짓 또는 프로빗 적합
4OR·예측확률·AME 계산
5AUC·로그손실·calibration 평가
6목적 비용으로 임계값 선택
9

대표 사례

계약기간과 문의횟수로 고객 이탈을 설명합니다

고객 1,500명의 다음 달 이탈을 로지스틱 회귀로 분석했습니다. 계약기간 계수 −.08, 문의횟수 계수 .35였습니다.

변수βOR해석
계약기간 1개월−.08.923이탈 오즈 약 7.7% 감소
문의 1회.351.42이탈 오즈 42% 증가
AUC.78순위 구분력
Brier.14확률오차

결과 해석

다른 변수가 같을 때 문의 1회 증가는 이탈 오즈 1.42배와 관련됐습니다. 평균 고객에서 예측확률은 문의 1회 증가 시 18%에서 24%로 6%p 상승했습니다.

10

주의점과 흔한 오해

분리·희귀사건·오즈비 과장을 확인합니다

어떤 변수 조합이 결과를 완벽히 분리하면 최대우도 계수가 발산할 수 있습니다. 희귀사건에서 오즈비는 위험비와 비슷하지만 사건이 흔하면 차이가 큽니다.

문제대응
완전분리Firth·베이지안·정규화
희귀사건표본설계·보정·PR 곡선
비선형 logit스플라인·변환
반복자료GEE·혼합로짓
임계값 .5 고정비용·유병률에 맞춰 선택
11

직접 해보기

계수와 X가 S자 확률곡선을 어떻게 움직이는지 봅니다

β와 X를 바꿔보세요. 같은 β라도 p가 .5 근처일 때 확률 변화가 크고 0이나 1 근처에서는 작아집니다.

로지스틱·프로빗 회귀 인터랙티브 랩

임계값을 움직이며 거짓 양성과 거짓 음성이 서로 교환되는 과정을 확인하세요.

임계값음성양성FP 0 · FN 0

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

p=1/(1+e⁻η)

확률 37.8%

η=−0.5+0.0×0.0=-0.50

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

12

핵심 정리

로지스틱·프로빗의 판단 규칙

요약은 아래 핵심 정리에서 확인합니다.

  • 로짓·프로빗은 이분형 결과의 조건부 확률을 0~1로 모델링한다.
  • 로지스틱 계수의 지수는 오즈비이며 확률비가 아니다.
  • 프로빗 계수는 잠재 정규지수 척도이므로 확률로 변환한다.
  • 확률효과는 기준확률에 따라 달라져 AME·예측확률이 필요하다.
  • AUC와 calibration은 서로 다른 성능이다.
  • 분리·희귀사건·누출·비선형성·임계값 비용을 확인한다.
13

더 깊이 알아보기

이분형 회귀의 확장을 살펴봅니다

다음 연결

결과가 0/1이 아니라 0,1,2…의 발생 건수라면 포아송·음이항 카운트 회귀를 사용합니다.

주제핵심 내용
Firth logistic분리와 작은 표본 편향 완화
Rare-events logistic희귀 양성의 편향 보정
Multinomial logit순서 없는 다범주 결과
Ordinal logit순서형 결과와 비례오즈
Mixed logistic군집별 임의효과 포함
다음: 카운트 데이터 회귀