모델의 가장 큰 향상은 더 똑똑한 알고리즘이 아니라 더 좋은 입력에서 나올 때가 많습니다. 파생 변수 만들기는 원본 열을 실제로 신호를 담은 변수로 바꾸는 기술입니다.
Note
가치 높은 변환
비율과 차이
두 열을 비율이나 격차를 담은 하나로 결합: 사용자당 매출, 그램당 가격, 마지막 주문 이후 경과일.
날짜 요소
원본 타임스탬프는 모델링이 어렵습니다. 요일·월·"주말 여부"로 바꾸면 모델이 이해하는 변수가 됩니다.
구간화
효과가 매끄럽게 선형이 아닐 때, 연속 변수를 구간(연령대, 가격대)으로 묶으세요.
상호작용
두 변수의 조합이 각각보다 중요할 때 곱하세요 — 예: 지역 × 상품.
흔한 실수
- 누수: 예측 시점에 없을 정보로 변수를 생성
- 가설 없이 수십 개 변수 생성 — 신호가 아니라 잡음
- 새 데이터에 같은 변환을 적용하는 걸 잊음
Watch out
SKARI 데이터 편집기의 파생 변수
SKARI의 데이터 편집기에서 파생 열 도구는 수식으로 새 변수를 만듭니다 — 산술과 함수로 열을 결합, 코드 불필요.
- 시각적 수식 편집기로 비율·차이·조건식 생성
- round, log, sqrt 같은 함수를 어떤 열에든 적용
- 모든 파생 열이 파이프라인 이력에 기록되어 재사용
Takeaway
자주 묻는 질문
변수가 많은 게 나은가요, 좋은 게 나은가요?
좋은 게 낫습니다. 근거 있는 몇 개가 잡음 많은 더미보다 낫고, 더미는 과적합만 부릅니다.
트리 모델도 파생 변수가 필요한가요?
선형 모델보단 덜하지만, 좋은 비율이나 날짜 요소는 여전히 도움이 됩니다 — 트리도 원본 열에 없는 관계를 지어내진 못합니다.
누수를 어떻게 피하나요?
예측 시점에 있을 정보만 쓰고, 학습/테스트 분할 후에 변수를 만드세요.
결론
파생 변수 만들기는 도메인 지식이 모델을 만나는 지점입니다. 원본 열을, 결과를 움직인다고 믿는 것을 표현하는 변수로 바꾸되, 누수를 경계하세요.
Takeaway
데이터 정규화 가이드
새 변수를 올바르게 스케일링
결측치 처리
만들기 전에 정제
회귀분석
어떤 변수가 실제로 중요한지 확인