Blog/회귀분석 완벽 가이드

Model Lab

회귀분석 완벽 가이드

계수, R², 잔차 해석

SK

Skari Team

Skari

2026년 7월·13분

선형 회귀

R² ≈ 0.8

회귀는 모든 점까지의 제곱 거리를 최소화하는 직선을 찾습니다.

회귀분석은 데이터 분석에서 가장 널리 사용되는 예측 모델 중 하나입니다. 매출, 가격, 위험 같은 수치를 예측할 뿐 아니라, 각 입력이 결과와 어떻게 관계되는지도 알려줍니다. 회귀분석의 핵심은 결국 해석에 있지만, 실제 분석에서는 이 단계까지 제대로 짚는 경우가 많지 않습니다.

Note

회귀계수는 다음과 같이 해석합니다: 다른 모든 변수를 고정했을 때, 이 입력이 한 단위 증가하면 결과는 얼마나 변하는가?

단순회귀 vs 다중회귀분석

단순회귀는 예측변수 하나(광고비 → 매출)를 씁니다. 다중회귀분석은 여럿(광고비, 가격, 계절 → 매출)을 한 번에 써서, 나머지를 통제하며 각각의 효과를 분리합니다. "다른 모든 것을 고정할 때"라는 표현이 실제로 의미를 갖는 것이 바로 다중회귀입니다.

계수 해석: 실제 예시로 보기

회귀분석에서 가장 유용한 능력은 계수를 문장으로 해석하는 것입니다. 매출 모델이 다음과 같이 나왔다고 합시다:

광고비  β = 2.35   (p < .001)

다음과 같이 해석합니다: 다른 변수를 동일하게 유지할 때, 광고비를 1단위(예: 1만 원) 늘리면 매출은 평균 2.35단위(2.35만 원) 증가합니다. 작은 p값은 그 효과가 0일 가능성이 매우 낮다는 뜻입니다.

Tip

항상 단위를 붙이세요. "β = 2.35"는 "광고비 1단위당 매출 2.35"라고 표현하기 전에는 의미가 없습니다. 중요한 것은 숫자가 아니라 그 숫자가 의미하는 해석입니다.

실제 출력 표 읽기

회귀 요약은 유의성이 붙은 계수 표입니다. 한눈에 읽는 법:

Coefficients (계수)
  변수          β        p
  (절편)       12.40    .000
  광고비        2.35    .000   <- 유의, 양(+)의 효과
  가격         -1.80    .012   <- 유의, 음(-)의 효과
  계절          0.42    .180   <- 비유의 (p > .05)

먼저 p값을 확인합니다: 광고비와 가격은 결과를 움직이지만, 계절은 그렇지 않습니다(p값이 0.05보다 커서 효과를 0과 구별할 수 없음). 그다음 부호를 확인합니다. 양수는 결과를 올리고 음수는 내립니다. 마지막으로 계수의 크기를 해석합니다.

적합도 지표: R²를 넘어

많은 사람들이 R²만 확인하곤 합니다. 중요한 점은 R²가 쓸모없는 변수라도 추가하기만 하면 항상 올라간다는 것입니다. 그래서 R²만 보면 과도하게 복잡한 모델을 좋게 평가하게 됩니다. 실무에서는 여러 지표를 함께 확인합니다.

지표알려주는 것왜 중요한가
설명된 분산 비율(0–1)직관적이지만 변수 많아지면 부풀려짐
수정 R² (Adjusted R²)예측변수 수로 벌점을 준 R²변수 수가 다른 모델 비교
RMSE결과 단위의 전형적 예측 오차실제로 체감되는 오차
AIC / BIC복잡도로 벌점을 준 적합도경쟁 모델 선택 — 낮을수록 좋음

Watch out

두 모델을 R²만으로 비교하지 마세요. 수정 R²(또는 AIC/BIC)로 큰 모델의 추가 변수가 실제로 필요한지 평가하고, RMSE로 실제 단위의 오차를 확인하세요.

네 가지 가정

  • 선형성: 관계가 실제로 직선
  • 독립성: 잔차가 상관되지 않음(시계열 주의)
  • 등분산성: 잔차 퍼짐이 범위에 걸쳐 일정
  • 잔차의 정규성: 오차가 대략 종 모양

네 가지 모두 잔차 플롯으로 확인합니다. 잔차가 R²보다 중요한 이유입니다.

네 가지 진단 플롯

신뢰할 수 있는 회귀분석 보고서에는 진단 플롯이 함께 포함됩니다. 각 플롯은 특정 가정을 점검합니다. 이렇게 잔차를 살펴봐야 성능 지표만으로는 드러나지 않는 잘못된 모델을 잡아낼 수 있습니다.

플롯점검 대상좋은 모습
Residual vs Fitted선형성, 등분산0 주위의 평평하고 패턴 없는 구름
Q-Q Plot잔차 정규성대각선을 껴안는 점들
Scale-Location등분산성평평한 추세 — 깔때기 모양 없음
Cook's Distance영향력 큰 이상치적합을 지배하는 단일 점 없음

Tip

Residual vs Fitted의 곡선은 관계가 비선형이라는 뜻이고, Scale-Location의 깔때기 모양은 분산이 예측값과 함께 커진다는 뜻이며, Cook's Distance의 스파이크는 특정 관측치가 모델에 과도한 영향을 미친다는 의미입니다.

흔한 실수

  • 잔차에 뚜렷한 구조가 있는데도 R²만 보고 모델을 평가함
  • 수정 R²/AIC/BIC 대신 R²로 모델 비교
  • 데이터 범위를 훨씬 벗어난 외삽
  • 다중공선성 무시 — 상관된 입력이 계수를 불안정하게 함(VIF 확인)
  • 관측 데이터에서 계수를 인과로 읽음

SKARI Model Lab의 회귀분석

Model Lab에서는 코드 없이 회귀분석을 수행합니다. 결과 변수와 예측변수를 선택해 실행하면 정리된 요약 결과를 확인할 수 있습니다. SKARI는 계수 표에서 그치지 않고, 전문적인 분석 보고서 전체를 한 번에 제공합니다.

Takeaway

SKARI는 계수에서 멈추지 않습니다. 다중공선성 진단을 위한 VIF, 잔차 진단 플롯, 가정 검정, 결과의 의미에 대한 AI 해석, 원클릭 Word 보고서까지 논문 작성에 필요한 분석 결과를 함께 제공합니다.
  • 유의성이 붙은 계수 표, 그리고 R²·수정 R²·RMSE·AIC/BIC
  • VIF와 다중공선성 진단
  • Residual, Q-Q, Scale-Location, Cook's Distance 플롯
  • AI 해석과 내보낼 수 있는 Word 보고서(또는 R / Python 코드)

자주 묻는 질문

회귀 계수는 어떻게 해석하나요?

다른 예측변수를 고정할 때, 계수는 그 예측변수 1단위 증가에 대한 결과의 평균 변화입니다. 항상 단위와 함께 말하세요.

높은 R²는 항상 좋은가요?

아니요. 잔차에 패턴이 있는데 R²만 높다면, 단순한 성능 지표만으로는 확인하기 어려운 방식으로 모델이 잘못됐다는 뜻입니다. 잔차 플롯을 확인하고, 모델 비교에는 수정 R²를 사용하세요.

R²와 수정 R² 중?

예측변수 수가 다른 모델을 비교할 땐 수정 R²를 쓰세요. 불필요한 변수에 벌점을 주기 때문입니다. R²만으로는 항상 큰 모델을 편애합니다.

다중공선성이란?

예측변수가 강하게 상관되면 모델이 그 효과를 분리하지 못해 계수가 크게 흔들립니다. VIF를 확인하고 변수를 빼거나 결합하세요.

결론

회귀분석은 해석 가능하기에 강력합니다. 다만 R²를 넘어 계수(단위와 함께), 적합도 지표, 가정, 잔차 플롯까지 읽을 때에 한합니다.

Takeaway

회귀 결과는 하나의 지표가 아니라 전체를 함께 해석해야 합니다. 각 계수를 해석하고, 수정 R²로 비교하고, 진단 플롯을 점검하면, 회귀분석은 무엇이 일어나는지뿐 아니라 왜 그런지도 알려줍니다.

관계 분석

선형에서 규제까지 회귀 family 전체

과적합과 정규화

Ridge와 Lasso로 계수를 축소할 때

데이터 정규화

계수를 비교 가능하게, 규제를 공정하게