결과변수의 분포와 평균의 범위에 맞춰 선형예측자를 연결합니다.
확률을 직선으로 예측하면 왜 0보다 작아질까?
가입 여부 0/1이나 사고 건수 0·1·2…를 OLS로 회귀하면 음의 확률이나 음의 건수를 예측할 수 있고 평균에 따라 분산이 달라지는 구조도 놓칩니다.
일반화선형모형은 선형결합 η=Xβ를 유지하면서 결과에 맞는 확률분포와 링크함수로 평균을 허용 범위에 묶습니다.
핵심 질문
결과의 분포와 평균 범위에 맞게 회귀의 선형 구조를 어떻게 확장할까요?
결과 유형에 맞춰 정규·이항·포아송 등의 분포를 고릅니다.
여러 예측변수의 가중합으로 체계적 부분을 만듭니다.
평균을 선형예측자와 연결해 가능한 값의 범위를 지킵니다.
확률분포·선형예측자·링크함수를 결합합니다
GLM은 Y의 조건부분포, η=β₀+βX인 선형예측자, 그리고 평균 μ와 η를 연결하는 g(μ)=η로 구성됩니다.
| 요소 | 역할 | 예시 |
|---|---|---|
| 무작위 성분 | Y의 분포 | 정규·이항·포아송·감마 |
| 체계적 성분 | 예측변수의 선형결합 η | β₀+β₁X₁+… |
| 링크함수 | μ를 η의 실수축에 연결 | identity·logit·log |
결과변수의 지지집합과 평균-분산 관계를 봅니다
결과가 연속인지, 0/1인지, 건수인지, 양의 연속값인지가 출발점입니다. GLM은 family마다 평균에 따른 분산함수 V(μ)를 함께 정의합니다.
| 결과 | 대표 family | 분산 구조 |
|---|---|---|
| 연속·대칭 | Gaussian | 상수 |
| 성공/실패 | Binomial | μ(1−μ) |
| 건수 | Poisson | μ |
| 양의 오른쪽 비대칭 | Gamma | μ² |
평균의 제한 범위를 선형예측자의 실수 범위와 연결합니다
η는 −∞부터 ∞까지 가능하지만 확률 μ는 0~1, 포아송 평균은 0보다 커야 합니다. 역링크는 어떤 η에서도 유효한 평균을 만듭니다.
| 링크 | 역링크·평균 | 대표 사용 |
|---|---|---|
| identity | μ=η | Gaussian |
| logit | μ=1/(1+e⁻η) | Binomial |
| log | μ=e^η | Poisson·Gamma |
| probit | μ=Φ(η) | Binomial |
링크는 결과를 변환하는 것과 다릅니다
GLM은 Y 자체를 로그변환하는 것이 아니라 조건부 평균 μ의 함수를 선형예측자와 연결합니다.
링크 척도와 결과 척도를 구분합니다
β는 기본적으로 링크 척도에서 X 1단위 변화량입니다. log 링크에서는 e^β가 평균비, logit에서는 e^β가 오즈비입니다. 실제 의미는 예측확률·예측평균·한계효과로 바꿔 읽는 것이 안전합니다.
| 링크 | β | e^β |
|---|---|---|
| identity | 평균의 가산 변화 | 일반적 핵심 의미 없음 |
| log | 로그 평균 변화 | 평균의 배수·IRR |
| logit | 로그오즈 변화 | 오즈비 |
| probit | 잠재 z척도 변화 | 확률로 변환 필요 |
최소제곱 대신 최대우도로 계수를 찾습니다
GLM은 관측자료가 가장 그럴듯해지는 β를 최대우도로 추정합니다. 반복가중최소제곱 IRLS는 현재 평균과 분산에 따라 가중치를 갱신하며 해를 찾습니다.
| OLS | GLM |
|---|---|
| 잔차제곱합 최소화 | 로그우도 최대화 |
| 상수분산 정규오차 | family별 분산함수 |
| 직접 선형 평균 | 링크를 통한 평균 |
| R² 중심 | deviance·AIC·예측성능 중심 |
deviance와 결과별 예측지표를 사용합니다
잔차 deviance는 포화모형 대비 적합 손실을, null deviance는 절편모형 대비 손실을 보여줍니다. AIC는 적합도와 모형복잡도를 함께 비교합니다.
| 지표 | 용도 |
|---|---|
| Null/Residual deviance | 예측변수로 줄인 부적합 |
| AIC | 같은 자료·결과의 후보모형 비교 |
| Deviance residual | 관측별 부적합 진단 |
| 분류 AUC·로그손실 | 이항 예측 평가 |
| RMSE·MAE·Poisson deviance | 평균·건수 예측 평가 |
과산포와 구조적 0을 별도로 확인합니다
포아송은 Var(Y|X)=E(Y|X)를 가정합니다. 관측분산이 더 크면 SE가 과소평가될 수 있어 quasi-Poisson, 음이항, 군집강건 SE를 고려합니다.
| 신호 | 가능한 원인 | 대응 |
|---|---|---|
| deviance/df≫1 | 과산포 | quasi·음이항 |
| 0이 예상보다 많음 | 구조적 0 | zero-inflated·hurdle |
| 군집별 잔차 | 의존성 | GEE·혼합 GLM |
| 비선형 패턴 | 평균식 누락 | 스플라인·상호작용 |
결과의 범위에서 진단까지 family와 link를 일관되게 선택합니다
결과의 자료형과 노출단위를 확인하고 family·link를 정합니다. 모형 적합 후 계수를 결과척도로 변환하고 deviance·잔차·과산포·영향점을 확인합니다.
| 단계 | 하는 일 |
|---|---|
| 1 | 결과 범위·0·노출시간 확인 |
| 2 | family와 link 선택 |
| 3 | 선형예측자와 상호작용 지정 |
| 4 | 최대우도로 적합 |
| 5 | 예측평균·비율·오즈비 해석 |
| 6 | deviance·분산·잔차 진단 |
사고 여부와 사고 건수에 맞는 모형을 고릅니다
운전자 2,000명의 사고 여부는 이항-logit, 사고 건수는 포아송-log GLM으로 분석합니다. 같은 X라도 결과와 링크가 다르면 계수 해석도 달라집니다.
| 결과 | 모형 | 계수 β | 결과척도 해석 |
|---|---|---|---|
| 사고 여부 | Binomial-logit | .405 | OR=e^.405=1.50 |
| 사고 건수 | Poisson-log | .182 | IRR=e^.182=1.20 |
| 보험비용 | Gamma-log | .095 | 평균비=e^.095=1.10 |
결과 해석
위험점수 1단위 증가는 사고 오즈 1.50배, 기대 사고건수 1.20배와 관련되었습니다. 오즈비와 평균비는 같은 수치가 아니며 결과별로 구분합니다.
family 이름만 맞춘다고 모형이 자동으로 적절해지지 않습니다
독립성, 선형예측자의 함수형태, 완전분리, 과산포, 영향점은 여전히 확인해야 합니다. 다른 링크의 계수 크기를 직접 비교해서도 안 됩니다.
| 오해 | 바른 판단 |
|---|---|
| GLM=일반 선형모형 | 확률분포와 링크를 쓰는 generalized 모형 |
| Y를 로그변환 | 평균에 log 링크 적용 |
| AIC 작으면 절대적 적합 | 후보 간 상대 비교 |
| 계수=확률 변화 | 역링크·한계효과로 변환 |
| 분포만 맞으면 충분 | 평균식·독립성도 진단 |
선형예측자와 링크가 평균의 범위를 어떻게 바꾸는지 봅니다
η와 링크 혼합값을 바꿔보세요. identity는 제한이 없고 log는 양수, logit은 0~1 범위의 평균을 만듭니다.
일반화선형모형(GLM) 인터랙티브 랩
관계·잡음·영향점을 바꾸며 회귀선, 잔차와 설명력이 동시에 어떻게 변하는지 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
log 역링크
양의 평균 1.00
η=0.0가 유효한 평균 범위로 변환됩니다.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
GLM의 판단 규칙
요약은 아래 핵심 정리에서 확인합니다.
GLM의 상관·계층 구조 확장을 살펴봅니다
다음 연결
이항 family에 logit 또는 probit 링크를 선택하면 로지스틱·프로빗 회귀가 됩니다.
| 주제 | 핵심 내용 |
|---|---|
| Exponential family | GLM이 사용하는 분포군의 공통 구조 |
| Canonical link | 충분통계와 자연모수를 연결 |
| Quasi-likelihood | 평균·분산관계만 지정 |
| GEE | 상관된 반복자료의 주변평균 |
| GLMM | 군집별 임의효과를 포함한 GLM |