통계의 거의 모든 방법은 행을 섞어도 아무것도 잃지 않는다고 가정합니다. 시계열은 그것이 거짓인 family입니다. 어제 값이 오늘을 알려주고, 지난 12월이 이번 12월을 닮습니다. 순서가 정보를 담으며, 행이 독립인 것처럼 분석하면 그 정보를 버립니다.
보상은 예측 — 위 점선 연장이 시사하듯 관측된 패턴을 미래로 연장하는 것입니다. 하지만 예측하기 전에, 시계열이 무엇으로 이루어졌는지 이해해야 합니다.
Note
분해: 시계열의 부분들
모든 시계열은 몇 개 성분의 합입니다. 그것들을 분리하는 것이 첫 단계이자 흔히 가장 밝혀주는 단계입니다.
| 성분 | 무엇인가 |
|---|---|
| 추세 | 장기 방향 — 상승, 하강, 또는 평평 |
| 계절성 | 반복되는 주기 — 주간·월간·연간 |
| 잔차 / 잡음 | 추세와 계절을 제거한 뒤 남는 것 |
혼란스러워 보이는 매출 시계열이 흔히 꾸준한 상승 추세, 강한 12월 급증, 약간의 잡음으로 분해됩니다. 추세 분석과 계절 분해가 그 구조를 명시적으로 만듭니다.
정상성: 전제 조건
많은 시계열 모델이 정상 시계열 — 통계적 성질이 시간에 따라 표류하지 않는 — 을 요구합니다. 추세나 커지는 분산을 가진 시계열은 정상이 아니며, 모델링 전에 보통 (흔히 차분으로) 변환해야 합니다.
Watch out
예측 모델들
| 모델 | 적합 |
|---|---|
| 지수평활 | 추세와 계절성, 단순하고 강건 |
| ARIMA | 정상성으로 차분한 뒤의 자기상관 시계열 |
| VAR / VECM | 함께 움직이는 여러 시계열 |
| GARCH 계열 | 군집하는 변동성 — 금융과 위험 |
ARIMA는 고전적 일꾼 — 정상 시계열을 그 자신의 과거 값과 오차로 모델링합니다. 지수평활은 흔히 그만큼 좋으면서 더 단순합니다. VAR은 상호작용하는 여러 시계열을 한 번에 다루고, GARCH는 수준이 아니라 변하는 변동성을 겨눕니다.
단 하나의 규칙: 시간을 절대 섞지 마라
시계열에서 가장 해로운 실수는 보통 데이터처럼 검증하는 것입니다. 행을 무작위로 나누면 모델이 과거를 예측하려고 미래를 엿보게 됩니다 — 쓸모없는 모델을 훌륭해 보이게 만드는 누수입니다.
- 1항상 과거로 학습하고 미래로 검증, 무작위 분할은 절대 금지.
- 2모든 테스트 창이 학습 창 뒤에 오도록 전진 연쇄(롤링) 분할 사용.
- 3프로덕션이 그러하듯, 진짜로 나중에 온 데이터로 예측을 판단.
Tip
SKARI Statistical Lab의 시계열
SKARI의 Statistical Lab은 시계열을 독립된 family — 가장 큰 방법 집합 — 로 다루며, 분해·정상성 점검·예측을 내장했습니다.
- 추세 분석과 계절 분해
- 지수평활과 ARIMA 예측
- 상호작용하는 여러 시계열을 위한 VAR / VECM
- 변동성을 위한 GARCH 계열 모델
- 순서를 절대 섞지 않는 시간 인식 검증
Takeaway
자주 묻는 질문
ARIMA와 지수평활 중?
지수평활이 더 단순하고 추세·계절 데이터엔 흔히 경쟁력 있습니다. ARIMA는 자기상관 시계열에 더 유연합니다. 둘 다 시도해 전진 검증에서 비교하세요.
정상성이 뭔지 빠르게?
평균과 분산이 시간에 따라 표류하지 않는 시계열. 추세와 커지는 퍼짐이 그것을 깨고, 차분이 대개 회복시킵니다.
보통의 학습/테스트 분할을 써도 되나요?
아니요 — 시간을 절대 섞지 마세요. 과거로 학습하고 미래로 테스트하지 않으면 점수가 누수로 부풀려집니다.
핵심 요약
신호
순서
자기상관
분해
추세+계절
분해하라
필요
정상성
먼저 차분
금지
섞기
시간은 전진
시계열 분석은 순서를 골칫거리가 아니라 신호로 다룹니다. 시계열을 분해하고, 정상으로 만들고, 그 구조에 맞는 모델을 적합하고, 전진 검증하면 — 진짜 미래가 도착할 때 예측이 버팁니다.
Takeaway
예측 모델링
예측의 지도 사촌
교차검증
시간 인식 분할
탐색적 데이터 분석
먼저 추세와 계절 발견