배우기
인터랙티브·

데이터 변환·로그변환

비대칭·비선형·이분산 관계를 더 다루기 쉬운 척도로 바꾸기

1

들어가며

매출이 10만 원 늘었다는 것과 10% 늘었다는 것은 서로 다른 변화이며 어떤 척도를 쓰느냐가 질문을 바꿉니다.

변환은 값을 삭제하지 않고 좌표계를 바꿉니다. 큰 값의 간격을 압축하고 곱셈 관계를 덧셈으로 바꾸거나 평균이 커질수록 커지는 분산을 안정화할 수 있습니다.

목표는 무조건 정규분포를 만드는 것이 아닙니다. 어떤 가정과 관계를 개선하려는지 먼저 정하고, 변환 후 계수·평균·예측이 원래 단위에서 무엇을 뜻하는지 설계해야 합니다.

핵심 질문

어떤 문제를 해결하려고 x와 y 중 무엇을 변환하며, 결과를 원단위의 차이·배율·백분율 중 무엇으로 해석할까?

원자료

오른쪽 꼬리

큰 양의 값과 증가하는 분산이 분석을 지배할 수 있습니다.

로그변환

비율 압축

곱셈 차이를 덧셈 차이로 바꾸고 큰 값을 상대적으로 압축합니다.

역변환 해석

원단위

계수와 예측값을 원래 단위의 비율·퍼센트 변화로 되돌립니다.

2

변환의 목적

변환은 한 문제를 개선하면서 다른 문제를 만들 수 있습니다. 로그는 오른쪽 꼬리를 줄이지만 0을 다루기 어렵고 원단위 평균 해석을 복잡하게 합니다.

관찰된 문제가능한 접근변환 뒤 확인
오른쪽 긴 꼬리log·sqrt꼬리·이상치 영향
곡선 관계log(x)·다항·spline선형성·외삽
평균과 함께 증가하는 분산log(y)·sqrt(y)잔차 대 적합값
0~1 비율logit·beta 회귀경계값 처리
단위 크기 차이표준화·robust scale거리·계수
3

로그변환

자연로그는 양수 x에서 정의되고, x의 같은 배율을 같은 거리로 바꿉니다. 10→20과 100→200은 원단위 차이는 10과 100이지만 모두 두 배이므로 로그 차이는 log(2)로 같습니다.

곱셈 관계 y=a·xᵝ·ε에 로그를 취하면 log(y)=log(a)+βlog(x)+log(ε)가 되어 선형모형으로 다루기 쉬워집니다. 큰 값의 영향도 압축됩니다.

로그 밑이 e인지 10인지에 따라 계수 숫자는 달라질 수 있지만 일관되게 해석하면 같은 관계를 표현합니다. 통계모형에서는 자연로그가 일반적입니다.

log(ab)=log(a)+log(b),log(a/b)=log(a)log(b)\operatorname{log}(ab)=\operatorname{log}(a)+\operatorname{log}(b), \operatorname{log}(a/b)=\operatorname{log}(a)-\operatorname{log}(b)
로그는 곱과 비율을 합과 차이로 바꿉니다.
4

0과 음수 처리

log(0)은 −∞이고 음수의 실수 로그는 정의되지 않습니다. 0이 실제 “없음”인지 검출한계 미만인지, 음수가 의미 있는 손실인지 먼저 확인합니다.

log1p(x)=log(1+x)는 0 이상 카운트에 편리하지만 상수 1은 변수 단위와 관련됩니다. 원 단위가 원에서 천 원으로 바뀌면 log(1+x)의 효과가 달라질 수 있습니다.

최솟값보다 큰 상수를 임의로 더하면 모든 간격과 계수가 선택한 상수에 의존합니다. 0이 많은 결과는 two-part·hurdle·카운트 모형, 음수를 포함한 예측변수는 Yeo–Johnson이나 의미 있는 재표현을 검토합니다.

5

로그 회귀 해석

log(y)=α+βx에서 x가 1 증가하면 y의 조건부 중심은 exp(β)배입니다. β=.1이면 약 1.105배, 즉 정확히 10.5% 증가입니다. 100β%는 |β|가 작을 때만 근사입니다.

y=α+βlog(x)에서는 x가 1% 증가할 때 y가 약 β/100 단위 변합니다. log(y)=α+βlog(x)에서는 β가 탄력성으로, x가 1% 증가할 때 y가 약 β% 변합니다.

x의 단위를 바꾸면 “1 증가”의 의미도 바뀝니다. 나이를 1년 단위로 넣은 계수와 10년 단위 계수는 10배 차이지만 같은 효과를 나타냅니다.

log(y)=α+βx%Δy=100[exp(βΔx)1]\operatorname{log}(y)=\alpha +\beta x \Rightarrow \%\Delta y=100[\operatorname{exp}(\beta \Delta x)-1]
β=.1, Δx=2이면 y는 exp(.2)−1≈22.1% 증가합니다.
6

제곱근·Box-Cox

제곱근은 0을 포함한 비음수 카운트에서 큰 값을 로그보다 덜 강하게 압축하고 평균과 함께 커지는 분산을 완화할 수 있습니다. 다만 현대 카운트 자료에는 Poisson·negative binomial GLM이 더 직접적일 수 있습니다.

Box–Cox는 양수자료에서 λ에 따라 로그(λ=0), 제곱근에 가까운 변환, 원자료(λ=1) 등을 하나의 계열로 비교합니다. λ는 정규성 하나가 아니라 모형 우도와 잔차를 기준으로 선택합니다.

λ를 전체 데이터에서 최적화하면 검증정보가 들어갑니다. 예측 평가에서는 훈련 폴드 안에서 λ를 추정하고 검증·테스트에 고정 적용합니다.

7

Yeo-Johnson

Yeo–Johnson은 0과 음수를 포함할 수 있도록 양수와 음수 영역에 다른 거듭제곱 공식을 적용합니다. 별도 상수를 더하지 않아도 된다는 장점이 있습니다.

하지만 자동 변환이 자료의 의미를 보존하거나 정규분포·좋은 예측을 보장하지는 않습니다. 손실이 의미 있는 음수라면 변환 후 계수의 업무 해석이 더 어려워질 수 있습니다.

변환 매개변수도 모델의 일부로 저장하고 새 데이터에 같은 값을 사용합니다. 분포가 크게 이동하면 재학습 기준을 정해야 합니다.

8

결과변수와 예측변수

y를 로그변환하면 제곱오차가 원단위 큰 오차보다 상대오차에 가까운 차이를 중시하게 되고 예측대상도 로그척도의 조건부 평균으로 바뀝니다. x 변환은 y의 손실은 유지한 채 관계의 모양과 한 단위의 의미를 바꿉니다.

트리모형의 분할 순서는 단조 x변환에 대체로 유지되지만 선형모형·KNN·SVM·PCA와 규제는 거리·형태가 바뀌어 결과가 크게 달라집니다. y변환은 트리모형에서도 손실과 예측을 바꿉니다.

정규성이 필요한 대상은 흔히 원자료가 아니라 회귀 잔차입니다. x나 y의 히스토그램만 정규에 가깝게 만들고 잔차 구조를 확인하지 않는 것은 목적을 놓친 변환입니다.

9

역변환 편향

로그척도 예측값을 exp하면 원척도의 조건부 중앙값에 가까우며 일반적으로 조건부 평균보다 작습니다. 비선형 함수에서는 평균을 변환한 값과 변환값의 평균이 같지 않기 때문입니다.

로그잔차가 정규이고 분산이 σ²로 일정하면 평균 예측에 exp(σ²/2)를 곱할 수 있습니다. Duan smearing은 잔차의 exp 평균을 사용해 분포 가정을 줄입니다.

이분산이면 하나의 보정계수도 x에 따라 달라질 수 있습니다. 원단위 예측구간과 평가 지표를 직접 확인해야 합니다.

E(YX)expE[log(Y)X]E(Y|X) \ne \operatorname{exp}{E[\operatorname{log}(Y)|X]}
역변환 목적이 중앙값인지 평균인지 먼저 정합니다.
10

진단과 보고

변환 전후 히스토그램만 보지 말고 산점도의 관계, 잔차 대 적합값, Q–Q plot, 영향점, 교차검증 오차를 비교합니다. 변환이 해석 가능성과 예측 성능을 실제로 개선했는지 확인합니다.

원단위의 n·중앙값·IQR·평균·범위와 변환척도의 모형식을 함께 제시합니다. 로그 밑, 0 처리, 매개변수 선택법, 역변환 보정과 최종 효과 단위를 명시합니다.

여러 변환을 시도해 가장 유의한 것만 선택하면 낙관적 편향이 생깁니다. 선택 과정을 모델 튜닝에 포함하고 독립 검증자료로 평가합니다.

11

직접 해보기

log(y)=α+βx 모형에서 계수와 x 변화량을 바꾸며 근사값이 아닌 정확한 백분율 효과를 확인하세요.

데이터 변환·로그변환 인터랙티브 랩

중심과 산포를 조절하며 분포의 위치·폭·꼬리와 요약값이 어떻게 달라지는지 확인하세요.

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

계산 결과

정확한 변화 +10.5%

배율은 1.105, 작은 계수 근사는 +10.0%입니다. |βΔx|가 커질수록 근사 오차가 커집니다.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

12

핵심 정리

  • 변환은 비대칭·비선형·이분산 문제를 특정 척도에서 완화합니다.
  • 로그는 양수에서 정의되며 0 처리 상수의 의미를 확인합니다.
  • 로그계수는 차이가 아니라 배수·백분율로 해석합니다.
  • y 역변환에는 평균 편향이 생길 수 있습니다.
  • 변환은 학습 폴드 안에서 선택하고 전후 진단과 원단위 결과를 보고합니다.
13

더 깊이 알아보기

주제핵심 내용
Spline구간별 다항식을 매끄럽게 연결해 임의 거듭제곱 하나보다 유연하게 비선형 관계를 표현하되 자유도와 외삽을 관리합니다.
Quantile Transform순위를 균등·정규분포에 매핑해 극단값 영향을 줄이지만 거리와 원단위 해석을 잃고 새 범위 밖 값의 처리가 어렵습니다.
Compositional Data합이 100%로 고정된 구성비는 한 성분 증가가 다른 성분 감소를 강제하므로 centered·isometric log-ratio 변환을 사용합니다.
다음 학습스케일링은 분포 모양을 바꾸기보다 변수의 중심과 크기를 맞춰 거리·규제·최적화가 단위에 지배되지 않게 합니다.
다음: 스케일링·표준화