현재 본문을 보고 있습니다
배우기
인터랙티브·

정규화: Ridge·Lasso·Elastic Net

계수에 벌점을 주어 잡음까지 외우는 회귀를 더 안정적으로 만듭니다.

1

들어가며

변수를 더 넣었는데 왜 새 고객 예측은 더 나빠질까?

예측변수 100개로 고객 매출을 회귀하면 학습자료에는 거의 완벽히 맞을 수 있습니다. 그러나 표본의 우연한 잡음까지 계수에 담기면 새 고객에서는 오차가 커집니다.

정규화는 예측오차에 계수 크기의 비용을 더해, 자료 적합과 모형 단순성 사이의 균형을 선택합니다.

핵심 질문

학습자료를 조금 덜 맞추는 대신 새 자료에서 더 안정적인 계수를 얻을 수 있을까요?

Ridge

L2

모든 계수를 부드럽게 줄여 공선성과 과적합을 완화합니다.

Lasso

L1

일부 계수를 정확히 0으로 만들어 변수 선택을 수행합니다.

Elastic Net

L1+L2

상관된 변수군의 안정성과 희소성을 절충합니다.

2

정규화란 무엇인가

손실함수에 계수 벌점을 추가합니다

보통 OLS는 잔차제곱합만 최소화합니다. 정규화 회귀는 RSS+λ×벌점을 최소화해 큰 계수를 축소합니다. 절편은 보통 벌점에서 제외합니다.

요소역할
RSS자료를 얼마나 잘 맞추는가
벌점계수가 얼마나 크고 복잡한가
λ적합보다 단순성을 얼마나 중시하는가
표준화변수 단위에 따른 벌점 차이를 제거
3

Ridge는 어떻게 작동하는가

계수 제곱합 L2에 비용을 매깁니다

Ridge는 λΣβⱼ²를 사용합니다. 큰 계수에 강한 비용을 주고 상관된 변수의 계수를 함께 나누어 축소하는 경향이 있습니다. 대개 정확히 0으로 만들지는 않습니다.

특성Ridge
벌점L2·계수 제곱합
변수 선택대개 모두 유지
상관 변수효과를 나누어 가짐
강점안정적 예측·다중공선성 완화
4

Lasso는 왜 0을 만드는가

계수 절댓값 합 L1의 모서리가 희소해를 만듭니다

Lasso는 λΣ|βⱼ|를 사용합니다. 절댓값 벌점은 0에서 뾰족하므로 최적해가 정확히 0에 놓일 수 있어 축소와 변수선택을 동시에 수행합니다.

특성Lasso
벌점L1·계수 절댓값 합
변수 선택일부 계수를 0으로 제거
상관 변수그룹 중 하나를 임의로 남길 수 있음
강점희소하고 간결한 모형

0이 곧 중요하지 않음은 아닙니다

상관된 변수 중 대체 가능한 하나가 선택된 결과일 수 있으며 표본이 달라지면 선택 변수도 바뀔 수 있습니다.

5

Elastic Net은 무엇을 결합하는가

L1과 L2를 함께 사용합니다

Elastic Net은 α로 L1과 L2의 비율을 정합니다. Lasso의 희소성과 Ridge의 상관 변수 그룹 안정성을 절충합니다.

α 또는 L1 ratio모형
0Ridge
0과 1 사이Elastic Net
1Lasso

언제 유용한가

예측변수가 많고 서로 강하게 상관되며 일부만 실제로 유용할 때 Elastic Net이 실용적입니다.

6

λ는 어떻게 선택하는가

학습오차가 아니라 교차검증 오차로 정합니다

λ=0이면 벌점 없는 회귀이고 λ가 커질수록 계수가 작아집니다. 최적 λ는 훈련자료 내부의 k-fold 교차검증으로 새 자료 오차가 작은 값을 선택합니다.

선택의미
최소오차 λ평균 CV 오차가 가장 작은 값
1-SE λ최소오차에서 1 SE 이내인 더 단순한 값
너무 작은 λ과적합·불안정 계수
너무 큰 λ과소적합·중요 신호까지 축소
7

결과는 어떻게 읽는가

계수 경로와 검증 성능을 함께 봅니다

λ에 따른 계수 경로는 어떤 변수가 언제 축소·제거되는지 보여줍니다. 최종 평가는 학습 R²보다 검증 RMSE·MAE·R²와 선택 안정성으로 합니다.

출력질문
선택 λ어느 복잡도가 최선인가?
비영 계수 수몇 변수가 남았는가?
계수 경로축소와 선택이 안정적인가?
검증 점수새 자료에서 실제로 개선되는가?
8

분석은 어떻게 이루어지는가

전처리와 검증을 하나의 파이프라인 안에서 수행합니다

훈련·검증을 나눈 뒤 훈련 fold 안에서 결측처리와 표준화를 학습해야 합니다. 전처리를 전체 자료에서 먼저 하면 검증정보가 새어 나갑니다.

단계하는 일
1결과·예측변수와 평가 지표 정의
2훈련·검증 분리
3fold 내부 전처리·표준화
4λ와 α 격자 교차검증
5최종 모형 재적합
6미사용 자료 성능·계수 안정성 평가
9

대표 사례

50개 고객 특성으로 다음 달 매출을 예측합니다

고객 1,000명, 예측변수 50개 자료에서 OLS와 세 정규화 모형을 같은 5-fold CV로 비교했습니다.

모형검증 RMSE남은 변수특징
OLS18.450계수 불안정
Ridge14.250상관 변수 함께 유지
Lasso14.89간결하지만 선택 변동
Elastic Net13.916최고 검증성능

결과 해석

Elastic Net은 16개 변수를 유지하며 가장 낮은 검증 RMSE를 보였습니다. 학습 적합이 가장 높은 OLS보다 새 고객 예측이 우수했습니다.

10

주의점과 흔한 오해

정규화는 추론과 인과문제를 자동 해결하지 않습니다

정규화 계수는 편향을 의도적으로 도입하며 일반 OLS p값을 그대로 붙일 수 없습니다. 변수선택 후 추론과 인과해석에는 별도 절차가 필요합니다.

오해바른 판단
Lasso 0=효과 없음예측상 대체 가능·표본 의존
λ를 학습오차로 선택교차검증으로 선택
표준화 불필요단위가 벌점에 직접 영향
Ridge가 공선성 제거계수 안정화이지 정보 생성 아님
정규화=인과선택예측 기준의 축소·선택
11

직접 해보기

λ와 L1 비율에 따라 축소와 선택이 어떻게 달라지는지 봅니다

λ를 키우면 계수 전체가 작아지고 L1 비율을 높이면 더 많은 계수가 정확히 0이 되는 경향을 관찰합니다.

정규화: Ridge·Lasso·Elastic Net 인터랙티브 랩

관계·잡음·영향점을 바꾸며 회귀선, 잔차와 설명력이 동시에 어떻게 변하는지 확인하세요.

규제 강도 λ

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

개념적 정규화 강도

축소 63% · 희소성 50%

λ=5.0, L1=0.5이면 Ridge에 가까운 축소입니다.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

12

핵심 정리

정규화의 판단 규칙

요약은 아래 핵심 정리에서 확인합니다.

  • 정규화는 예측오차와 계수 크기의 비용을 함께 최소화한다.
  • Ridge는 L2로 모든 계수를 안정적으로 축소한다.
  • Lasso는 L1로 일부 계수를 정확히 0으로 만든다.
  • Elastic Net은 희소성과 상관 변수 안정성을 절충한다.
  • 변수 표준화와 fold 내부 전처리가 필수적이다.
  • λ와 α는 교차검증 및 미사용 자료 성능으로 선택한다.
13

더 깊이 알아보기

정규화 이후의 확장을 살펴봅니다

다음 연결

정규화는 선형회귀뿐 아니라 로지스틱·포아송 등 일반화선형모형에도 같은 방식으로 적용할 수 있습니다.

주제핵심 내용
계수 경로λ에 따른 각 계수 변화
1-SE 규칙성능이 비슷한 더 단순한 모형
선택 안정성재표본마다 변수 선택 빈도
Adaptive Lasso변수별 가중 벌점
Group Lasso더미·변수군을 함께 선택
다음: 일반화선형모형(GLM)