잘 맞아 보이는 숫자 뒤에서 모형이 체계적으로 틀리는 부분을 찾습니다.
R²=.95면 모형을 믿어도 될까?
매출 회귀의 R²가 .95라면 매우 좋아 보입니다. 하지만 잔차가 곡선을 이루거나 한 대형 매장이 회귀선을 끌고 갔다면 높은 R²와 별개로 계수와 예측은 잘못될 수 있습니다.
회귀 진단은 하나의 점수로 모형을 합격시키는 절차가 아니라, 모형이 자료의 어떤 구조를 놓쳤는지 찾는 과정입니다.
핵심 질문
이 모형의 오차는 무작위로 남아 있는가, 아니면 아직 설명하지 못한 패턴이 있는가?
전체 변동 중 회귀식이 설명한 비율을 확인합니다.
곡선·부채꼴·군집이 남으면 모형 가정이 맞지 않을 수 있습니다.
한 관측을 제외했을 때 계수와 예측이 크게 바뀌는지 봅니다.
실제값에서 회귀선의 예측값을 뺀 오차입니다
잔차 eᵢ=yᵢ−ŷᵢ입니다. 양수면 과소예측, 음수면 과대예측입니다. OLS 절편이 있으면 잔차 합은 0이지만 이는 모형이 올바르다는 뜻이 아닙니다.
| 잔차 | 뜻 |
|---|---|
| e=0 | 관측값과 예측값이 일치 |
| e>0 | 실제가 예측보다 큼·과소예측 |
| e<0 | 실제가 예측보다 작음·과대예측 |
| |e| 큼 | 해당 관측의 예측오차가 큼 |
표본 내 Y 변동 중 회귀가 줄인 비율입니다
R²=1−SSE/SST입니다. 평균만 사용했을 때의 총오차 SST와 회귀선의 잔차오차 SSE를 비교합니다.
| R² | 해석 |
|---|---|
| 0 | 평균만 쓰는 것보다 SSE를 줄이지 못함 |
| .60 | 표본 Y 변동의 60%를 선형모형이 설명 |
| 1 | 표본을 완벽히 적합 |
| 음수 | 검증자료나 무절편 모형에서 평균보다 나쁜 예측 가능 |
설명은 인과가 아닙니다
R²의 설명은 수학적 변동 감소를 뜻하며 원인을 밝혔다는 의미가 아닙니다.
변수 수와 새 자료 성능을 구분합니다
학습 R²는 변수를 추가하면 내려가지 않습니다. 조정 R²는 불필요한 변수에 벌점을 주지만 여전히 같은 표본 안의 지표입니다. 일반화 성능은 별도 검증이나 교차검증 R²로 확인합니다.
| 지표 | 장점 | 한계 |
|---|---|---|
| R² | 표본 내 적합도 직관적 | 변수 추가로 자동 증가 |
| 조정 R² | 변수 수를 벌점 | 과적합을 완전히 막지 못함 |
| 검증 R² | 새 자료 예측력 측정 | 데이터 분할 변동 존재 |
| RMSE·MAE | 원래 단위 오차 | Y 규모에 의존 |
무작위 구름에서 벗어나는 패턴을 봅니다
잔차 대 적합값 그림이 0 주변에 일정한 폭으로 무작위 분포하면 선형성과 등분산성이 대체로 맞습니다. 곡선은 비선형성, 부채꼴은 이분산성, 시간 순서의 파동은 자기상관 신호입니다.
| 패턴 | 가능한 문제 |
|---|---|
| U자·S자 | 누락된 비선형 관계 |
| 부채꼴 | 이분산성 |
| 연속된 양·음 잔차 | 자기상관·집단 누락 |
| 고립된 큰 잔차 | 이상치·입력오류·모형 실패 |
Y가 이상한 점과 X가 특별한 점을 구분합니다
이상치는 잔차가 큰 점, 고레버리지는 X공간에서 멀리 떨어진 점입니다. 영향점은 그 관측을 제거했을 때 계수나 예측이 크게 바뀌는 점이며 두 특성이 결합될 때 자주 나타납니다.
| 진단 | 보는 것 |
|---|---|
| 표준화 잔차 | Y방향의 이례성 |
| 레버리지 hᵢᵢ | X조합의 이례성 |
| Cook’s distance | 전체 계수에 미치는 영향 |
| DFBETAS | 특정 계수 변화량 |
영향점은 삭제 명령이 아닙니다
오류인지 실제 중요한 사례인지 확인하고 포함·제외 민감도 분석을 보고합니다.
설계와 예측 목적에서 출발합니다
먼저 데이터 누출, 시간 순서, 독립성을 확인한 뒤 함수 형태·분산·영향점을 봅니다. 정규성은 작은 표본에서 계수 추론에 중요하지만 예측 정확성 자체의 필수조건은 아닙니다.
| 우선 | 확인 |
|---|---|
| 1 | 설계·누출·독립성 |
| 2 | 선형성·누락된 구조 |
| 3 | 이분산·자기상관 |
| 4 | 이상치·레버리지·영향 |
| 5 | 잔차 정규성·추론 안정성 |
적합과 진단을 반복합니다
모형을 적합하고 R²·오차를 확인한 뒤 잔차그림과 영향점 진단을 수행합니다. 문제가 발견되면 데이터 오류, 변수 변환, 상호작용, 강건 SE, 다른 모형을 검토하고 다시 검증합니다.
| 단계 | 산출물 |
|---|---|
| 적합 | 계수·R²·RMSE |
| 잔차진단 | 선형성·분산·정규성 |
| 영향진단 | 잔차·레버리지·Cook’s D |
| 수정 | 변환·항 추가·강건 방법 |
| 검증 | 홀드아웃·교차검증 성능 |
광고비로 매출을 예측한 모형을 진단합니다
매장 80개의 광고비·매출 회귀에서 학습 R²=.82였지만 잔차그림은 광고비가 큰 구간에서 아래로 굽고 한 대형 매장의 Cook’s D가 컸습니다.
| 진단 | 결과 | 판단 |
|---|---|---|
| 학습 R² | .82 | 표본 적합은 높음 |
| 검증 R² | .61 | 일반화 격차 존재 |
| 잔차 곡선 | 확인 | 포화효과 누락 |
| Cook’s D | 1개 점 .74 | 계수 민감도 확인 |
| 수정 | log(광고비)+민감도 분석 | 검증 R²=.70 |
결과 해석
높은 R²에도 선형식은 광고비의 포화효과를 놓쳤고 한 매장에 민감했습니다. 변환 후 검증성능과 잔차패턴이 개선되어 수정 모형을 선택했습니다.
한 지표로 모형을 확정하지 않습니다
R²가 높아도 편향, 누출, 잘못된 함수형태가 있을 수 있고 낮아도 잡음이 큰 분야에서 유용한 효과를 추정할 수 있습니다. 잔차가 정규라는 이유만으로 선형성·독립성·인과성이 보장되지 않습니다.
| 오해 | 바른 판단 |
|---|---|
| R²가 높으면 정확 | 검증오차와 잔차 확인 |
| 잔차 큰 점은 삭제 | 원인·영향·민감도 확인 |
| 조정 R²면 과적합 해결 | 외부 검증 필요 |
| 정규 잔차면 좋은 모형 | 다른 가정과 설계 별도 확인 |
설명된 변동과 잔차 변동이 R²를 어떻게 바꾸는지 봅니다
모형이 설명한 변동과 남은 오차를 바꿔보세요. R²가 같은 두 모형도 잔차 패턴과 검증 성능은 다를 수 있음을 기억합니다.
회귀 진단·결정계수 R²·잔차 인터랙티브 랩
관계·잡음·영향점을 바꾸며 회귀선, 잔차와 설명력이 동시에 어떻게 변하는지 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
R² = SSR ÷ (SSR+SSE)
R² 0.50
총변동 101 중 모형이 50을 설명합니다.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
회귀 진단의 판단 규칙
요약은 아래 핵심 정리에서 확인합니다.
잔차 이후의 진단을 확장합니다
다음 연결
잔차의 폭이 변하거나 시간 순서로 이어지는 패턴은 이분산성과 자기상관이라는 별도 문제로 이어집니다.
| 주제 | 핵심 내용 |
|---|---|
| PRESS | 각 관측을 제외한 예측오차 |
| 학생화 잔차 | 관측별 분산을 반영한 잔차 |
| Cook’s D | 계수 전체의 영향도 |
| 교차검증 | 일반화 오차 반복 추정 |
| 부분잔차도 | 각 X의 조건부 함수형태 진단 |