회귀분석은 데이터 분석에서 가장 널리 사용되는 예측 모델 중 하나입니다. 매출, 가격, 위험 같은 수치를 예측할 뿐 아니라, 각 입력이 결과와 어떻게 관계되는지도 알려줍니다. 회귀분석의 핵심은 결국 해석에 있지만, 실제 분석에서는 이 단계까지 제대로 짚는 경우가 많지 않습니다.
Note
단순회귀 vs 다중회귀분석
단순회귀는 예측변수 하나(광고비 → 매출)를 씁니다. 다중회귀분석은 여럿(광고비, 가격, 계절 → 매출)을 한 번에 써서, 나머지를 통제하며 각각의 효과를 분리합니다. "다른 모든 것을 고정할 때"라는 표현이 실제로 의미를 갖는 것이 바로 다중회귀입니다.
계수 해석: 실제 예시로 보기
회귀분석에서 가장 유용한 능력은 계수를 문장으로 해석하는 것입니다. 매출 모델이 다음과 같이 나왔다고 합시다:
광고비 β = 2.35 (p < .001)
다음과 같이 해석합니다: 다른 변수를 동일하게 유지할 때, 광고비를 1단위(예: 1만 원) 늘리면 매출은 평균 2.35단위(2.35만 원) 증가합니다. 작은 p값은 그 효과가 0일 가능성이 매우 낮다는 뜻입니다.
Tip
실제 출력 표 읽기
회귀 요약은 유의성이 붙은 계수 표입니다. 한눈에 읽는 법:
Coefficients (계수) 변수 β p (절편) 12.40 .000 광고비 2.35 .000 <- 유의, 양(+)의 효과 가격 -1.80 .012 <- 유의, 음(-)의 효과 계절 0.42 .180 <- 비유의 (p > .05)
먼저 p값을 확인합니다: 광고비와 가격은 결과를 움직이지만, 계절은 그렇지 않습니다(p값이 0.05보다 커서 효과를 0과 구별할 수 없음). 그다음 부호를 확인합니다. 양수는 결과를 올리고 음수는 내립니다. 마지막으로 계수의 크기를 해석합니다.
적합도 지표: R²를 넘어
많은 사람들이 R²만 확인하곤 합니다. 중요한 점은 R²가 쓸모없는 변수라도 추가하기만 하면 항상 올라간다는 것입니다. 그래서 R²만 보면 과도하게 복잡한 모델을 좋게 평가하게 됩니다. 실무에서는 여러 지표를 함께 확인합니다.
| 지표 | 알려주는 것 | 왜 중요한가 |
|---|---|---|
| R² | 설명된 분산 비율(0–1) | 직관적이지만 변수 많아지면 부풀려짐 |
| 수정 R² (Adjusted R²) | 예측변수 수로 벌점을 준 R² | 변수 수가 다른 모델 비교 |
| RMSE | 결과 단위의 전형적 예측 오차 | 실제로 체감되는 오차 |
| AIC / BIC | 복잡도로 벌점을 준 적합도 | 경쟁 모델 선택 — 낮을수록 좋음 |
Watch out
네 가지 가정
- 선형성: 관계가 실제로 직선
- 독립성: 잔차가 상관되지 않음(시계열 주의)
- 등분산성: 잔차 퍼짐이 범위에 걸쳐 일정
- 잔차의 정규성: 오차가 대략 종 모양
네 가지 모두 잔차 플롯으로 확인합니다. 잔차가 R²보다 중요한 이유입니다.
네 가지 진단 플롯
신뢰할 수 있는 회귀분석 보고서에는 진단 플롯이 함께 포함됩니다. 각 플롯은 특정 가정을 점검합니다. 이렇게 잔차를 살펴봐야 성능 지표만으로는 드러나지 않는 잘못된 모델을 잡아낼 수 있습니다.
| 플롯 | 점검 대상 | 좋은 모습 |
|---|---|---|
| Residual vs Fitted | 선형성, 등분산 | 0 주위의 평평하고 패턴 없는 구름 |
| Q-Q Plot | 잔차 정규성 | 대각선을 껴안는 점들 |
| Scale-Location | 등분산성 | 평평한 추세 — 깔때기 모양 없음 |
| Cook's Distance | 영향력 큰 이상치 | 적합을 지배하는 단일 점 없음 |
Tip
흔한 실수
- 잔차에 뚜렷한 구조가 있는데도 R²만 보고 모델을 평가함
- 수정 R²/AIC/BIC 대신 R²로 모델 비교
- 데이터 범위를 훨씬 벗어난 외삽
- 다중공선성 무시 — 상관된 입력이 계수를 불안정하게 함(VIF 확인)
- 관측 데이터에서 계수를 인과로 읽음
SKARI Model Lab의 회귀분석
Model Lab에서는 코드 없이 회귀분석을 수행합니다. 결과 변수와 예측변수를 선택해 실행하면 정리된 요약 결과를 확인할 수 있습니다. SKARI는 계수 표에서 그치지 않고, 전문적인 분석 보고서 전체를 한 번에 제공합니다.
Takeaway
- 유의성이 붙은 계수 표, 그리고 R²·수정 R²·RMSE·AIC/BIC
- VIF와 다중공선성 진단
- Residual, Q-Q, Scale-Location, Cook's Distance 플롯
- AI 해석과 내보낼 수 있는 Word 보고서(또는 R / Python 코드)
자주 묻는 질문
회귀 계수는 어떻게 해석하나요?
다른 예측변수를 고정할 때, 계수는 그 예측변수 1단위 증가에 대한 결과의 평균 변화입니다. 항상 단위와 함께 말하세요.
높은 R²는 항상 좋은가요?
아니요. 잔차에 패턴이 있는데 R²만 높다면, 단순한 성능 지표만으로는 확인하기 어려운 방식으로 모델이 잘못됐다는 뜻입니다. 잔차 플롯을 확인하고, 모델 비교에는 수정 R²를 사용하세요.
R²와 수정 R² 중?
예측변수 수가 다른 모델을 비교할 땐 수정 R²를 쓰세요. 불필요한 변수에 벌점을 주기 때문입니다. R²만으로는 항상 큰 모델을 편애합니다.
다중공선성이란?
예측변수가 강하게 상관되면 모델이 그 효과를 분리하지 못해 계수가 크게 흔들립니다. VIF를 확인하고 변수를 빼거나 결합하세요.
결론
회귀분석은 해석 가능하기에 강력합니다. 다만 R²를 넘어 계수(단위와 함께), 적합도 지표, 가정, 잔차 플롯까지 읽을 때에 한합니다.
Takeaway
관계 분석
선형에서 규제까지 회귀 family 전체
과적합과 정규화
Ridge와 Lasso로 계수를 축소할 때
데이터 정규화
계수를 비교 가능하게, 규제를 공정하게