Lasso의 희소성과 Ridge의 안정성을 한 모형 안에서 조절합니다.
비슷한 예측변수가 많을 때 무엇을 남겨야 할까?
고객 매출을 예측하려고 최근 구매액, 월평균 구매액, 주문횟수, 방문횟수처럼 서로 비슷한 변수 수십 개를 넣었다고 합시다. OLS는 계수가 흔들리고, Lasso는 상관된 변수 중 하나만 남겨 표본이 바뀔 때 선택이 달라질 수 있습니다. Ridge는 안정적이지만 모든 변수를 남깁니다.
Elastic Net은 Lasso의 L1 벌점과 Ridge의 L2 벌점을 함께 사용합니다. 일부 계수를 정확히 0으로 만들 가능성을 유지하면서, 상관된 변수들의 신호를 지나치게 한 변수에 몰지 않도록 조절합니다.
핵심 질문
변수를 줄이는 간결성과 상관된 신호를 안정적으로 유지하는 예측력을 어떻게 함께 얻을 수 있을까요?
자료 적합과 L1·L2 계수 비용을 함께 최소화합니다
선형회귀의 한 표기는 RSS+λ[αΣ|βⱼ|+(1−α)/2 Σβⱼ²]를 최소화하는 것입니다. RSS는 자료 적합, λ는 전체 벌점 강도, α는 L1과 L2의 혼합 비율입니다.
절편은 보통 벌점에서 제외합니다. 소프트웨어마다 표본 수로 나누는 방식이나 L2의 1/2 계수가 달라 같은 숫자의 λ를 직접 비교할 수 없으므로, 사용한 구현과 매개변수 정의를 보고합니다.
| 요소 | 역할 |
|---|---|
| RSS 또는 손실 | 학습자료를 얼마나 잘 맞추는가 |
| λ | 전체 축소 강도 |
| α 또는 L1 ratio | L1과 L2의 혼합 비율 |
| L1 부분 | 희소한 계수·변수 선택 유도 |
| L2 부분 | 상관계수 안정화·부드러운 축소 |
α=0은 Ridge, α=1은 Lasso입니다
α=0이면 L2만 남아 Ridge와 같고, α=1이면 L1만 남아 Lasso와 같습니다. 0<α<1인 경우가 좁은 의미의 Elastic Net이며 두 성질을 동시에 가집니다.
α가 1에 가까울수록 더 많은 계수가 0이 되는 경향이 있고, 0에 가까울수록 상관된 변수들이 함께 남는 경향이 있습니다. 그러나 실제 희소성은 α뿐 아니라 λ, 자료의 스케일과 상관구조에도 좌우됩니다.
| α | 가까운 모형 | 일반적 경향 |
|---|---|---|
| 0 | Ridge | 모든 계수를 부드럽게 축소 |
| 0.2 | Ridge 성격이 강한 Elastic Net | 상관된 변수군을 넓게 유지 |
| 0.5 | 균형형 Elastic Net | 축소와 희소성 절충 |
| 0.8 | Lasso 성격이 강한 Elastic Net | 더 적은 변수 유지 |
| 1 | Lasso | 일부 계수를 정확히 0으로 |
α는 중요도 점수가 아닙니다
α=.7은 “Lasso가 70% 더 좋다”는 뜻이 아니라 목적함수에서 L1 벌점이 차지하는 혼합 비율입니다.
선택의 불안정성을 줄이면서 희소성을 남깁니다
Lasso는 예측정보가 거의 같은 변수 여러 개가 있으면 그중 하나를 선택하고 나머지를 0으로 만들 수 있습니다. 어느 변수가 선택되는지는 표본의 작은 변화에도 달라질 수 있습니다.
Elastic Net의 L2 부분은 상관된 계수들이 비슷하게 움직이도록 돕는 그룹화 경향을 만듭니다. 동시에 L1 부분은 불필요한 변수군이나 약한 변수를 0으로 보낼 수 있습니다. 다만 상관된 변수가 항상 한 그룹으로 함께 선택된다는 보장은 없습니다.
| 상황 | Lasso 경향 | Elastic Net 경향 |
|---|---|---|
| 강한 상관 변수 | 하나를 임의로 선택 가능 | 여러 변수를 함께 유지할 가능성 |
| p≫n | 최대 n개 선택 제약 가능 | n보다 많은 비영 계수도 가능 |
| 약한 잡음 변수 | 0으로 제거 | α·λ에 따라 제거 |
| 간결성 | 높음 | 조절 가능 |
같은 α에서도 전체 축소 강도를 바꿉니다
λ=0이면 벌점 없는 회귀이고 λ가 커질수록 계수는 0 쪽으로 이동합니다. 너무 작은 λ는 학습자료의 잡음까지 따라가고, 너무 큰 λ는 실제 신호까지 줄여 과소적합할 수 있습니다.
λ의 후보는 보통 로그 간격의 경로로 만들고, 각 α마다 교차검증 오차가 낮은 λ를 찾습니다. 최적점 하나만 보지 말고 오차곡선이 평평한지와 계수경로가 안정적인지도 봅니다.
| λ 상태 | 계수·성능 경향 |
|---|---|
| 0 또는 매우 작음 | 약한 축소·과적합 가능 |
| 중간 | 편향과 분산의 균형 |
| 매우 큼 | 강한 축소·과소적합 가능 |
변수 단위가 벌점의 크기를 결정하기 때문입니다
연소득은 만 단위, 클릭률은 0~1 범위라면 같은 예측기여를 가진 계수도 숫자 크기가 크게 다릅니다. 표준화 없이 벌점을 주면 단위 때문에 어떤 변수는 더 강하게 축소됩니다.
평균과 표준편차는 전체 자료가 아니라 각 훈련 fold 안에서 계산하고 검증 fold에 적용합니다. 더미변수의 표준화 여부와 절편 처리 방식은 구현에 따라 다르므로 파이프라인 설정을 확인합니다.
계수의 원래 단위
모형 적합은 표준화된 변수로 하더라도, 보고할 때는 계수를 원래 단위로 되돌리거나 표준화 계수임을 명시합니다. 예측값은 같은 전처리 파이프라인을 거쳐 계산합니다.
2차원 튜닝을 교차검증 안에서 수행합니다
먼저 α 후보를 예를 들어 0.1, 0.3, 0.5, 0.7, 0.9로 정하고, 각 α에서 λ 경로를 탐색합니다. k-fold 교차검증의 평균 RMSE·MAE·로그손실 등 목적 지표가 좋은 조합을 선택합니다.
최소오차 조합은 예측성능을 우선합니다. 1-SE 규칙은 최소오차에서 표준오차 하나 이내인 조합 중 더 강한 정규화나 더 단순한 모형을 택하지만, α와 λ가 함께 움직일 때 “더 단순함”의 기준을 사전에 정해야 합니다.
| 선택 기준 | 장점 | 주의 |
|---|---|---|
| 최소 CV 오차 | 평균 예측성능 우선 | 선택 변수가 많을 수 있음 |
| 1-SE 규칙 | 더 간결하고 안정적일 수 있음 | 단순성 기준 명시 |
| 업무 제약 포함 | 변수 수·측정비용 반영 | 검증성능과 함께 평가 |
테스트 자료로 튜닝하지 않습니다
α와 λ를 고르는 데 사용한 자료는 최종 성능평가에 재사용하지 않습니다. 별도 테스트 세트나 중첩 교차검증으로 낙관 편향을 줄입니다.
튜닝 성능과 최종 일반화 성능을 분리합니다
외부 fold는 새 자료 성능을 평가하고, 각 외부 훈련자료 안의 내부 fold에서 α·λ를 선택합니다. 이 중첩 구조는 튜닝 과정까지 포함한 전체 파이프라인의 성능을 평가합니다.
결측 대치, 범주 인코딩, 표준화, 저분산 변수 제거, 특성선택은 모두 fold 안에서 학습해야 합니다. 전체 자료로 전처리한 뒤 교차검증하면 검증 fold의 정보가 훈련에 새어 들어갑니다.
| 구간 | 역할 |
|---|---|
| 외부 훈련 fold | 전처리와 내부 튜닝 수행 |
| 내부 CV | α·λ 선택 |
| 외부 검증 fold | 튜닝된 파이프라인 평가 |
| 최종 미사용 자료 | 가능하면 마지막 한 번 확인 |
검증 성능·계수 경로·선택 안정성을 함께 봅니다
최종 α와 λ만 제시하면 왜 그 모형이 선택되었는지 알기 어렵습니다. 교차검증 오차곡선, 비영 계수 수, 계수경로, 미사용 자료 성능을 함께 보고합니다.
재표본이나 fold마다 선택된 변수가 달라지는지 선택 빈도를 확인합니다. 예측성능이 비슷한 모형 여러 개가 있다면 더 단순하고 측정비용이 낮으며 선택이 안정적인 모형을 선호할 수 있습니다.
| 출력 | 질문 |
|---|---|
| 선택 α·λ | 어느 혼합과 축소가 선택됐는가? |
| 비영 계수 수 | 얼마나 희소한가? |
| 계수 경로 | λ에 따라 계수가 어떻게 사라지는가? |
| 선택 빈도 | 표본이 바뀌어도 변수가 남는가? |
| 검증 RMSE·MAE·R² | 새 자료에서 얼마나 잘 예측하는가? |
설계부터 독립 평가까지 하나의 파이프라인으로 묶습니다
결과변수, 예측시점, 후보변수와 평가 지표를 먼저 정의합니다. 시간 자료라면 무작위 fold 대신 과거로 미래를 예측하는 시간분할을 사용하고, 같은 사람의 반복자료가 fold를 넘지 않게 합니다.
선택된 모형은 전체 훈련자료에 다시 적합한 뒤 테스트 자료에서 평가합니다. 배포 후에는 변수 분포 변화, 결측률, 예측오차와 계수 안정성을 모니터링합니다.
| 단계 | 하는 일 |
|---|---|
| 1 | 예측대상·시점·평가지표 정의 |
| 2 | 훈련·검증 구조와 누출 경로 설계 |
| 3 | fold 내부 결측처리·인코딩·표준화 |
| 4 | α×λ 격자 교차검증 |
| 5 | 계수경로·희소성·선택 안정성 검토 |
| 6 | 독립자료 평가와 모니터링 계획 |
50개 고객특성으로 다음 달 매출을 예측합니다
고객 1,000명과 예측변수 50개로 OLS, Ridge, Lasso, Elastic Net을 같은 외부 5-fold 평가에서 비교했습니다. 내부 CV에서 Elastic Net은 α=.35와 λ=.18을 선택했습니다.
| 모형 | 외부 CV RMSE | 남은 변수 | 특징 |
|---|---|---|---|
| OLS | 18.4 | 50 | 상관계수 불안정 |
| Ridge | 14.2 | 50 | 신호를 넓게 유지 |
| Lasso | 14.8 | 9 | 간결하지만 선택 변동 |
| Elastic Net | 13.9 | 16 | 희소성과 안정성 절충 |
결과 해석
Elastic Net은 16개 변수를 유지하면서 평균 외부 CV RMSE 13.9로 가장 낮았습니다. 이는 이 자료와 검증설계에서 예측성능이 좋았다는 뜻이며, 선택된 16개 변수가 매출의 원인이라는 뜻은 아닙니다.
예측변수 수·상관구조·운영 목적을 함께 봅니다
예측변수가 많고 서로 강하게 상관되며, 완전한 Ridge보다 변수 수를 줄이고 싶을 때 유용합니다. 반대로 변수 수가 적고 계수가 안정적이거나, 명확한 추론이 주목적이라면 복잡한 튜닝의 이득이 작을 수 있습니다.
α를 포함한 추가 튜닝은 계산비용과 선택 불확실성을 늘립니다. Ridge나 Lasso와 성능 차이가 거의 없다면 더 단순한 선택도 합리적입니다. 최종 결정은 예측성능, 변수 측정비용, 설명 가능성, 배포 안정성을 함께 반영합니다.
| 상황 | 우선 고려 |
|---|---|
| 상관변수가 많고 희소성도 필요 | Elastic Net |
| 대부분의 작은 신호를 유지 | Ridge |
| 매우 간결한 변수집합 우선 | Lasso |
| 추론·인과효과가 핵심 | 설계 기반 모형과 별도 추론 |
축소와 변수선택이 추론·인과를 자동 해결하지 않습니다
정규화 계수는 분산을 줄이기 위해 편향을 의도적으로 도입합니다. 선택된 모형에 일반 OLS 표준오차와 p값을 그대로 붙이면 선택과 튜닝의 불확실성을 무시합니다.
한 변수의 계수가 0이라는 것은 현재 표본·전처리·α·λ·상관구조에서 예측상 제외되었다는 뜻입니다. 효과가 존재하지 않거나 중요하지 않다는 증거가 아니며, 상관된 대체변수가 그 신호를 담았을 수 있습니다.
| 오해 | 바른 판단 |
|---|---|
| α=.5가 항상 최선 | α와 λ를 자료·목적으로 검증 |
| 0 계수=효과 없음 | 현재 튜닝에서 예측상 제외 |
| 그룹화=상관변수 모두 선택 | 함께 남는 경향이지 보장 아님 |
| CV 최고점=확정 성능 | fold 변동·독립평가 함께 확인 |
| 선택 변수=핵심 원인 | 예측 선택과 인과는 별도 질문 |
λ와 L1 비율이 축소와 희소성을 어떻게 나누는지 봅니다
λ를 키우면 전체 축소가 강해지고, 같은 λ에서 α를 높이면 L1 성격과 희소성이 커지는 경향을 확인해 보세요. 실제 계수 변화는 변수 상관과 스케일에 따라 달라지므로 이 실습값은 원리를 보여주는 개념적 지표입니다.
Elastic Net 회귀 인터랙티브 랩
중심과 산포를 조절하며 분포의 위치·폭·꼬리와 요약값이 어떻게 달라지는지 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
L1 비율 50%
개념적 축소 63%
λ=5.0, α=0.5: 희소성과 안정성의 절충입니다. 실제 비영 계수 수는 데이터에 따라 달라집니다.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
Elastic Net의 판단 규칙
요약은 아래 핵심 정리에서 확인합니다.
혼합 벌점 이후의 확장을 살펴봅니다
다음 연결
같은 Elastic Net 벌점은 연속형 결과뿐 아니라 로지스틱·포아송 같은 일반화선형모형에도 적용할 수 있으며, 손실함수와 성능지표만 결과 형태에 맞게 바뀝니다.
| 주제 | 핵심 내용 |
|---|---|
| 계수 경로 | α·λ 변화에 따른 각 계수의 이동 |
| 중첩 교차검증 | 튜닝과 일반화 성능평가 분리 |
| 안정성 선택 | 재표본별 선택빈도로 변수집합 평가 |
| Adaptive Elastic Net | 변수별 가중 L1 벌점 |
| Sparse Group Lasso | 변수군과 개별변수를 동시에 선택 |