여러 조건을 함께 고려해 각 변수의 고유한 관계를 추정합니다.
면적이 넓어서 비싼가, 좋은 지역이라서 비싼가?
넓은 주택은 대개 좋은 지역에 있고 방 수도 많습니다. 면적만 가격과 회귀하면 면적 계수에는 지역과 방 수의 차이까지 섞일 수 있습니다.
다중회귀는 여러 예측변수를 동시에 넣어 나머지 변수를 같은 값으로 비교할 때 한 변수와 결과의 관계를 추정합니다.
핵심 질문
다른 조건이 같을 때 이 변수 하나가 달라지면 결과의 평균은 얼마나 달라질까요?
각 계수는 나머지 예측변수를 일정하게 둔 조건부 변화입니다.
비슷한 정보를 가진 변수들이 계수의 불확실성을 키웁니다.
VIF·조건수와 표본 변경 시 계수 흔들림을 함께 확인합니다.
여러 예측변수의 조건부 관계를 한 모형에서 추정합니다
모형은 ŷ=b₀+b₁X₁+…+bₚXₚ입니다. 각 계수는 모형에 들어간 다른 변수들을 일정하게 유지한 조건부 변화량입니다.
| 구성 | 예시 | 계수의 질문 |
|---|---|---|
| 결과 Y | 주택가격 | 무엇을 설명할까? |
| X₁ | 면적 | 지역·방 수가 같을 때 면적 효과는? |
| X₂ | 지역 | 면적·방 수가 같을 때 지역 차이는? |
| X₃ | 방 수 | 면적·지역이 같을 때 방 하나의 관계는? |
자료 안에서 다른 변수 값이 비슷한 관측치를 비교합니다
통제는 현실에서 변수를 고정하는 실험과 완전히 같지 않습니다. 회귀는 관측자료에서 공변량이 같은 경우의 평균 차이를 수학적으로 추정합니다. 자료에 그런 비교가 거의 없으면 계수는 외삽에 가까워집니다.
계수 읽기
면적 계수 0.35백만원이면 지역과 방 수가 같을 때 면적 1㎡ 증가와 평균 가격 35만원 증가가 관련된다는 뜻입니다.
통제변수 선택
결과를 보고 유의한 변수만 고르는 것이 아니라 연구 질문과 인과 구조를 바탕으로 교란변수를 정해야 합니다.
중요한 공통원인을 빼면 계수가 다른 효과를 대신 담습니다
누락된 변수가 X와 Y 모두에 관련되면 포함된 X의 계수가 편향될 수 있습니다. 반대로 매개변수나 충돌변수를 무조건 통제하면 원하는 총효과를 제거하거나 새 편향을 만들 수 있습니다.
| 변수 역할 | 통제 효과 |
|---|---|
| 교란변수 | 주요 편향을 줄일 수 있음 |
| 매개변수 | 총효과 일부를 제거 |
| 충돌변수 | 조건화로 가짜 관계 생성 가능 |
| 결과 이후 변수 | 인과 순서를 깨뜨릴 수 있음 |
예측변수들이 서로 비슷한 정보를 제공하는 상태입니다
면적과 방 수처럼 예측변수 사이의 선형관계가 강하면 모형은 두 변수의 결합 효과는 알지만 각각의 몫을 안정적으로 나누기 어렵습니다.
| 공선성의 결과 | 설명 |
|---|---|
| 계수 SE 증가 | 개별 계수의 불확실성이 커짐 |
| 부호·크기 불안정 | 표본이나 변수 조합에 따라 크게 변함 |
| p값 증가 | 전체 예측력은 높아도 개별 유의성은 낮음 |
| 예측은 유지 가능 | 관측 범위 안의 결합 예측은 괜찮을 수 있음 |
한 예측변수가 나머지 변수로 설명되는 정도를 봅니다
VIFⱼ=1/(1−Rⱼ²)입니다. Xⱼ를 다른 X들로 회귀한 R²가 높을수록 VIF가 커지고 계수분산이 팽창합니다.
| VIF | 일반적 해석 | 주의 |
|---|---|---|
| 1 | 선형 중복 없음 | 이상적 기준 |
| 2~5 | 중간 중복 가능 | 맥락·계수 안정성 확인 |
| 5 이상 | 강한 공선성 신호 | 절대 규칙은 아님 |
| 무한대 | 완전 공선성 | 계수 분리 불가능 |
VIF만으로 변수 삭제 금지
변수가 연구의 핵심이거나 다항항·상호작용 때문에 구조적으로 높은 경우 목적을 보고 판단합니다.
전체 모형과 개별 계수를 분리합니다
F검정과 R²는 예측변수 집합 전체가 결과를 설명하는지 보고, t검정과 신뢰구간은 다른 변수를 통제한 개별 계수를 평가합니다.
| 출력 | 질문 |
|---|---|
| 조정 R² | 변수 수를 고려한 설명력은? |
| 계수·CI | 통제 후 방향과 가능한 크기는? |
| 부분 R² | 변수의 고유 기여는? |
| VIF | 계수 분리가 얼마나 불안정한가? |
변수 선택보다 설계와 목적을 먼저 정합니다
결과·주요 노출·교란 후보를 사전에 정의하고 결측·범주 코딩·스케일을 확인합니다. 적합 후 전체 성능, 계수, 공선성, 잔차, 영향점을 차례로 봅니다.
| 단계 | 하는 일 |
|---|---|
| 1 | 연구 질문과 인과 순서 정의 |
| 2 | 변수 코딩·결측·범위 확인 |
| 3 | 상관행렬과 산점도 확인 |
| 4 | 모형 적합과 계수·CI 해석 |
| 5 | VIF·잔차·Cook’s D 진단 |
| 6 | 검증자료로 예측 성능 확인 |
주택가격을 면적·연식·역세권으로 설명합니다
주택 300채를 분석해 가격(백만원)=120+0.42×면적−1.8×연식+35×역세권 모형을 얻었다고 합시다.
| 변수 | 계수 | 95% CI | VIF |
|---|---|---|---|
| 면적(㎡) | 0.42 | [0.35,0.49] | 3.8 |
| 연식(년) | −1.8 | [−2.3,−1.3] | 1.4 |
| 역세권(1/0) | 35 | [22,48] | 2.1 |
결과 해석
다른 변수가 같을 때 면적 1㎡는 평균 가격 42만원 증가, 연식 1년은 180만원 감소와 관련되었습니다. 이는 관찰자료의 조건부 관계이며 인과효과로 자동 해석되지 않습니다.
선형성·공통지지·영향점·과적합을 확인합니다
각 X와 Y의 조건부 관계가 선형인지, 비교할 공변량 조합이 자료에 실제로 존재하는지 확인합니다. 변수 수가 표본에 비해 많으면 학습자료 R²는 오르지만 새 자료 성능은 나빠질 수 있습니다.
| 문제 | 대응 |
|---|---|
| 비선형 | 변환·스플라인 |
| 높은 VIF | 변수 목적 재검토·결합·정규화 |
| 영향점 | Cook’s D·민감도 분석 |
| 과적합 | 교차검증·정규화 |
| 내생성 | 설계·IV·패널 등 별도 방법 |
예측변수 상관과 표본 크기가 VIF·불확실성에 미치는 영향을 봅니다
예측변수 간 상관이 커지면 같은 표본에서도 개별 계수의 불확실성이 증가합니다. 표본을 늘리면 일부 완화되지만 완전한 중복은 해결되지 않습니다.
다중회귀·다중공선성 인터랙티브 랩
관계·잡음·영향점을 바꾸며 회귀선, 잔차와 설명력이 동시에 어떻게 변하는지 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
두 예측변수의 단순화된 VIF
VIF 1.29
표본 260개에서도 r=0.47이면 계수분산이 약 1.3배 팽창합니다.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
다중회귀의 판단 규칙
요약은 아래 핵심 정리에서 확인합니다.
조건부 계수 이후의 확장을 살펴봅니다
다음 연결
계수를 해석하기 전에는 잔차와 영향점을 통해 모형이 자료를 어떻게 놓치고 있는지 확인해야 합니다.
| 주제 | 핵심 내용 |
|---|---|
| 부분회귀도 | 다른 X를 제거한 뒤 남은 관계 |
| 부분 R² | 한 변수의 고유 설명력 |
| 주성분회귀 | 상관된 X를 직교 성분으로 변환 |
| Ridge | 상관 계수를 함께 축소해 안정화 |
| DAG | 통제변수 선택을 인과 구조로 표현 |