계수에 벌점을 주어 잡음까지 외우는 회귀를 더 안정적으로 만듭니다.
변수를 더 넣었는데 왜 새 고객 예측은 더 나빠질까?
예측변수 100개로 고객 매출을 회귀하면 학습자료에는 거의 완벽히 맞을 수 있습니다. 그러나 표본의 우연한 잡음까지 계수에 담기면 새 고객에서는 오차가 커집니다.
정규화는 예측오차에 계수 크기의 비용을 더해, 자료 적합과 모형 단순성 사이의 균형을 선택합니다.
핵심 질문
학습자료를 조금 덜 맞추는 대신 새 자료에서 더 안정적인 계수를 얻을 수 있을까요?
모든 계수를 부드럽게 줄여 공선성과 과적합을 완화합니다.
일부 계수를 정확히 0으로 만들어 변수 선택을 수행합니다.
상관된 변수군의 안정성과 희소성을 절충합니다.
손실함수에 계수 벌점을 추가합니다
보통 OLS는 잔차제곱합만 최소화합니다. 정규화 회귀는 RSS+λ×벌점을 최소화해 큰 계수를 축소합니다. 절편은 보통 벌점에서 제외합니다.
| 요소 | 역할 |
|---|---|
| RSS | 자료를 얼마나 잘 맞추는가 |
| 벌점 | 계수가 얼마나 크고 복잡한가 |
| λ | 적합보다 단순성을 얼마나 중시하는가 |
| 표준화 | 변수 단위에 따른 벌점 차이를 제거 |
계수 제곱합 L2에 비용을 매깁니다
Ridge는 λΣβⱼ²를 사용합니다. 큰 계수에 강한 비용을 주고 상관된 변수의 계수를 함께 나누어 축소하는 경향이 있습니다. 대개 정확히 0으로 만들지는 않습니다.
| 특성 | Ridge |
|---|---|
| 벌점 | L2·계수 제곱합 |
| 변수 선택 | 대개 모두 유지 |
| 상관 변수 | 효과를 나누어 가짐 |
| 강점 | 안정적 예측·다중공선성 완화 |
계수 절댓값 합 L1의 모서리가 희소해를 만듭니다
Lasso는 λΣ|βⱼ|를 사용합니다. 절댓값 벌점은 0에서 뾰족하므로 최적해가 정확히 0에 놓일 수 있어 축소와 변수선택을 동시에 수행합니다.
| 특성 | Lasso |
|---|---|
| 벌점 | L1·계수 절댓값 합 |
| 변수 선택 | 일부 계수를 0으로 제거 |
| 상관 변수 | 그룹 중 하나를 임의로 남길 수 있음 |
| 강점 | 희소하고 간결한 모형 |
0이 곧 중요하지 않음은 아닙니다
상관된 변수 중 대체 가능한 하나가 선택된 결과일 수 있으며 표본이 달라지면 선택 변수도 바뀔 수 있습니다.
L1과 L2를 함께 사용합니다
Elastic Net은 α로 L1과 L2의 비율을 정합니다. Lasso의 희소성과 Ridge의 상관 변수 그룹 안정성을 절충합니다.
| α 또는 L1 ratio | 모형 |
|---|---|
| 0 | Ridge |
| 0과 1 사이 | Elastic Net |
| 1 | Lasso |
언제 유용한가
예측변수가 많고 서로 강하게 상관되며 일부만 실제로 유용할 때 Elastic Net이 실용적입니다.
학습오차가 아니라 교차검증 오차로 정합니다
λ=0이면 벌점 없는 회귀이고 λ가 커질수록 계수가 작아집니다. 최적 λ는 훈련자료 내부의 k-fold 교차검증으로 새 자료 오차가 작은 값을 선택합니다.
| 선택 | 의미 |
|---|---|
| 최소오차 λ | 평균 CV 오차가 가장 작은 값 |
| 1-SE λ | 최소오차에서 1 SE 이내인 더 단순한 값 |
| 너무 작은 λ | 과적합·불안정 계수 |
| 너무 큰 λ | 과소적합·중요 신호까지 축소 |
계수 경로와 검증 성능을 함께 봅니다
λ에 따른 계수 경로는 어떤 변수가 언제 축소·제거되는지 보여줍니다. 최종 평가는 학습 R²보다 검증 RMSE·MAE·R²와 선택 안정성으로 합니다.
| 출력 | 질문 |
|---|---|
| 선택 λ | 어느 복잡도가 최선인가? |
| 비영 계수 수 | 몇 변수가 남았는가? |
| 계수 경로 | 축소와 선택이 안정적인가? |
| 검증 점수 | 새 자료에서 실제로 개선되는가? |
전처리와 검증을 하나의 파이프라인 안에서 수행합니다
훈련·검증을 나눈 뒤 훈련 fold 안에서 결측처리와 표준화를 학습해야 합니다. 전처리를 전체 자료에서 먼저 하면 검증정보가 새어 나갑니다.
| 단계 | 하는 일 |
|---|---|
| 1 | 결과·예측변수와 평가 지표 정의 |
| 2 | 훈련·검증 분리 |
| 3 | fold 내부 전처리·표준화 |
| 4 | λ와 α 격자 교차검증 |
| 5 | 최종 모형 재적합 |
| 6 | 미사용 자료 성능·계수 안정성 평가 |
50개 고객 특성으로 다음 달 매출을 예측합니다
고객 1,000명, 예측변수 50개 자료에서 OLS와 세 정규화 모형을 같은 5-fold CV로 비교했습니다.
| 모형 | 검증 RMSE | 남은 변수 | 특징 |
|---|---|---|---|
| OLS | 18.4 | 50 | 계수 불안정 |
| Ridge | 14.2 | 50 | 상관 변수 함께 유지 |
| Lasso | 14.8 | 9 | 간결하지만 선택 변동 |
| Elastic Net | 13.9 | 16 | 최고 검증성능 |
결과 해석
Elastic Net은 16개 변수를 유지하며 가장 낮은 검증 RMSE를 보였습니다. 학습 적합이 가장 높은 OLS보다 새 고객 예측이 우수했습니다.
정규화는 추론과 인과문제를 자동 해결하지 않습니다
정규화 계수는 편향을 의도적으로 도입하며 일반 OLS p값을 그대로 붙일 수 없습니다. 변수선택 후 추론과 인과해석에는 별도 절차가 필요합니다.
| 오해 | 바른 판단 |
|---|---|
| Lasso 0=효과 없음 | 예측상 대체 가능·표본 의존 |
| λ를 학습오차로 선택 | 교차검증으로 선택 |
| 표준화 불필요 | 단위가 벌점에 직접 영향 |
| Ridge가 공선성 제거 | 계수 안정화이지 정보 생성 아님 |
| 정규화=인과선택 | 예측 기준의 축소·선택 |
λ와 L1 비율에 따라 축소와 선택이 어떻게 달라지는지 봅니다
λ를 키우면 계수 전체가 작아지고 L1 비율을 높이면 더 많은 계수가 정확히 0이 되는 경향을 관찰합니다.
정규화: Ridge·Lasso·Elastic Net 인터랙티브 랩
관계·잡음·영향점을 바꾸며 회귀선, 잔차와 설명력이 동시에 어떻게 변하는지 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
개념적 정규화 강도
축소 63% · 희소성 50%
λ=5.0, L1=0.5이면 Ridge에 가까운 축소입니다.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
정규화의 판단 규칙
요약은 아래 핵심 정리에서 확인합니다.
정규화 이후의 확장을 살펴봅니다
다음 연결
정규화는 선형회귀뿐 아니라 로지스틱·포아송 등 일반화선형모형에도 같은 방식으로 적용할 수 있습니다.
| 주제 | 핵심 내용 |
|---|---|
| 계수 경로 | λ에 따른 각 계수 변화 |
| 1-SE 규칙 | 성능이 비슷한 더 단순한 모형 |
| 선택 안정성 | 재표본마다 변수 선택 빈도 |
| Adaptive Lasso | 변수별 가중 벌점 |
| Group Lasso | 더미·변수군을 함께 선택 |