현재 본문을 보고 있습니다
배우기
인터랙티브·

일반화선형모형(GLM)

결과변수의 분포와 평균의 범위에 맞춰 선형예측자를 연결합니다.

1

들어가며

확률을 직선으로 예측하면 왜 0보다 작아질까?

가입 여부 0/1이나 사고 건수 0·1·2…를 OLS로 회귀하면 음의 확률이나 음의 건수를 예측할 수 있고 평균에 따라 분산이 달라지는 구조도 놓칩니다.

일반화선형모형은 선형결합 η=Xβ를 유지하면서 결과에 맞는 확률분포와 링크함수로 평균을 허용 범위에 묶습니다.

핵심 질문

결과의 분포와 평균 범위에 맞게 회귀의 선형 구조를 어떻게 확장할까요?

확률분포

랜덤 성분

결과 유형에 맞춰 정규·이항·포아송 등의 분포를 고릅니다.

선형예측자

여러 예측변수의 가중합으로 체계적 부분을 만듭니다.

연결함수

link

평균을 선형예측자와 연결해 가능한 값의 범위를 지킵니다.

2

GLM의 세 구성요소

확률분포·선형예측자·링크함수를 결합합니다

GLM은 Y의 조건부분포, η=β₀+βX인 선형예측자, 그리고 평균 μ와 η를 연결하는 g(μ)=η로 구성됩니다.

요소역할예시
무작위 성분Y의 분포정규·이항·포아송·감마
체계적 성분예측변수의 선형결합 ηβ₀+β₁X₁+…
링크함수μ를 η의 실수축에 연결identity·logit·log
3

분포 family는 어떻게 고르는가

결과변수의 지지집합과 평균-분산 관계를 봅니다

결과가 연속인지, 0/1인지, 건수인지, 양의 연속값인지가 출발점입니다. GLM은 family마다 평균에 따른 분산함수 V(μ)를 함께 정의합니다.

결과대표 family분산 구조
연속·대칭Gaussian상수
성공/실패Binomialμ(1−μ)
건수Poissonμ
양의 오른쪽 비대칭Gammaμ²
4

링크함수는 왜 필요한가

평균의 제한 범위를 선형예측자의 실수 범위와 연결합니다

η는 −∞부터 ∞까지 가능하지만 확률 μ는 0~1, 포아송 평균은 0보다 커야 합니다. 역링크는 어떤 η에서도 유효한 평균을 만듭니다.

링크역링크·평균대표 사용
identityμ=ηGaussian
logitμ=1/(1+e⁻η)Binomial
logμ=e^ηPoisson·Gamma
probitμ=Φ(η)Binomial

링크는 결과를 변환하는 것과 다릅니다

GLM은 Y 자체를 로그변환하는 것이 아니라 조건부 평균 μ의 함수를 선형예측자와 연결합니다.

5

계수는 어떻게 해석하는가

링크 척도와 결과 척도를 구분합니다

β는 기본적으로 링크 척도에서 X 1단위 변화량입니다. log 링크에서는 e^β가 평균비, logit에서는 e^β가 오즈비입니다. 실제 의미는 예측확률·예측평균·한계효과로 바꿔 읽는 것이 안전합니다.

링크βe^β
identity평균의 가산 변화일반적 핵심 의미 없음
log로그 평균 변화평균의 배수·IRR
logit로그오즈 변화오즈비
probit잠재 z척도 변화확률로 변환 필요
6

어떻게 추정하는가

최소제곱 대신 최대우도로 계수를 찾습니다

GLM은 관측자료가 가장 그럴듯해지는 β를 최대우도로 추정합니다. 반복가중최소제곱 IRLS는 현재 평균과 분산에 따라 가중치를 갱신하며 해를 찾습니다.

OLSGLM
잔차제곱합 최소화로그우도 최대화
상수분산 정규오차family별 분산함수
직접 선형 평균링크를 통한 평균
R² 중심deviance·AIC·예측성능 중심
7

적합도는 어떻게 평가하는가

deviance와 결과별 예측지표를 사용합니다

잔차 deviance는 포화모형 대비 적합 손실을, null deviance는 절편모형 대비 손실을 보여줍니다. AIC는 적합도와 모형복잡도를 함께 비교합니다.

지표용도
Null/Residual deviance예측변수로 줄인 부적합
AIC같은 자료·결과의 후보모형 비교
Deviance residual관측별 부적합 진단
분류 AUC·로그손실이항 예측 평가
RMSE·MAE·Poisson deviance평균·건수 예측 평가
8

분산이 맞지 않으면

과산포와 구조적 0을 별도로 확인합니다

포아송은 Var(Y|X)=E(Y|X)를 가정합니다. 관측분산이 더 크면 SE가 과소평가될 수 있어 quasi-Poisson, 음이항, 군집강건 SE를 고려합니다.

신호가능한 원인대응
deviance/df≫1과산포quasi·음이항
0이 예상보다 많음구조적 0zero-inflated·hurdle
군집별 잔차의존성GEE·혼합 GLM
비선형 패턴평균식 누락스플라인·상호작용
9

분석은 어떻게 이루어지는가

결과의 범위에서 진단까지 family와 link를 일관되게 선택합니다

결과의 자료형과 노출단위를 확인하고 family·link를 정합니다. 모형 적합 후 계수를 결과척도로 변환하고 deviance·잔차·과산포·영향점을 확인합니다.

단계하는 일
1결과 범위·0·노출시간 확인
2family와 link 선택
3선형예측자와 상호작용 지정
4최대우도로 적합
5예측평균·비율·오즈비 해석
6deviance·분산·잔차 진단
10

대표 사례

사고 여부와 사고 건수에 맞는 모형을 고릅니다

운전자 2,000명의 사고 여부는 이항-logit, 사고 건수는 포아송-log GLM으로 분석합니다. 같은 X라도 결과와 링크가 다르면 계수 해석도 달라집니다.

결과모형계수 β결과척도 해석
사고 여부Binomial-logit.405OR=e^.405=1.50
사고 건수Poisson-log.182IRR=e^.182=1.20
보험비용Gamma-log.095평균비=e^.095=1.10

결과 해석

위험점수 1단위 증가는 사고 오즈 1.50배, 기대 사고건수 1.20배와 관련되었습니다. 오즈비와 평균비는 같은 수치가 아니며 결과별로 구분합니다.

11

주의점과 흔한 오해

family 이름만 맞춘다고 모형이 자동으로 적절해지지 않습니다

독립성, 선형예측자의 함수형태, 완전분리, 과산포, 영향점은 여전히 확인해야 합니다. 다른 링크의 계수 크기를 직접 비교해서도 안 됩니다.

오해바른 판단
GLM=일반 선형모형확률분포와 링크를 쓰는 generalized 모형
Y를 로그변환평균에 log 링크 적용
AIC 작으면 절대적 적합후보 간 상대 비교
계수=확률 변화역링크·한계효과로 변환
분포만 맞으면 충분평균식·독립성도 진단
12

직접 해보기

선형예측자와 링크가 평균의 범위를 어떻게 바꾸는지 봅니다

η와 링크 혼합값을 바꿔보세요. identity는 제한이 없고 log는 양수, logit은 0~1 범위의 평균을 만듭니다.

일반화선형모형(GLM) 인터랙티브 랩

관계·잡음·영향점을 바꾸며 회귀선, 잔차와 설명력이 동시에 어떻게 변하는지 확인하세요.

X

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

log 역링크

양의 평균 1.00

η=0.0가 유효한 평균 범위로 변환됩니다.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

13

핵심 정리

GLM의 판단 규칙

요약은 아래 핵심 정리에서 확인합니다.

  • GLM은 분포 family·선형예측자·링크함수로 구성된다.
  • family는 결과 범위와 평균-분산 관계로 선택한다.
  • 링크는 평균의 제한 범위를 실수인 η와 연결한다.
  • 계수는 링크 척도이므로 오즈비·평균비·예측값으로 변환한다.
  • 적합은 최대우도, 평가는 deviance·AIC·예측성능으로 한다.
  • 과산포·구조적 0·독립성·함수형태를 진단한다.
14

더 깊이 알아보기

GLM의 상관·계층 구조 확장을 살펴봅니다

다음 연결

이항 family에 logit 또는 probit 링크를 선택하면 로지스틱·프로빗 회귀가 됩니다.

주제핵심 내용
Exponential familyGLM이 사용하는 분포군의 공통 구조
Canonical link충분통계와 자연모수를 연결
Quasi-likelihood평균·분산관계만 지정
GEE상관된 반복자료의 주변평균
GLMM군집별 임의효과를 포함한 GLM
다음: 로지스틱·프로빗 회귀