배우기
인터랙티브·

표본추출·데이터 분할

대표성 있는 자료를 모으고 미래 일반화를 정직하게 평가하기

1

들어가며

데이터가 100만 행이어도 한 앱의 적극적인 사용자만 포함됐다면 전체 고객을 대표하지 못합니다.

표본추출은 목표모집단에서 누구를 관측할지 정하고, 데이터 분할은 관측된 자료 중 무엇을 모델 개발과 정직한 평가에 사용할지 정합니다. 둘은 모두 일반화 범위를 설계하는 일입니다.

표본편향, 같은 사람의 중복, 미래정보가 섞인 평가는 복잡한 모델로 해결되지 않습니다. 평가셋이 실제 배포 환경을 닮지 않으면 높은 점수도 의사결정에 쓸 수 없습니다.

핵심 질문

누구와 어느 시점에 일반화하려 하며, 선택확률과 평가분할은 그 사용환경을 얼마나 정직하게 재현하는가?

모집단과 표본틀

대표성

누가 뽑힐 수 있고 누가 빠지는지부터 확인합니다.

학습·검증·테스트

역할 분리

학습·선택·최종 평가에 서로 다른 자료를 사용합니다.

층화·그룹·시간

구조 보존

자료 의존성을 유지한 채 현실의 새 사례를 모사하도록 나눕니다.

2

모집단과 표본틀

목표모집단은 결론을 적용하려는 전체 대상, 표본틀은 실제 추출 가능한 명단, 응답표본은 최종 관측된 대상입니다. 세 집단의 차이를 명시해야 합니다.

전국 성인을 연구하면서 온라인 패널만 표본틀로 쓰면 비사용자는 처음부터 선택될 수 없습니다. 표본틀에서 빠진 집단은 그 안에서 아무리 무작위로 뽑아도 복구되지 않습니다.

포함·제외 기준, 조사기간, 접촉불가와 무응답 흐름을 기록합니다. 표본 수보다 어떤 경로로 최종 분석표본이 되었는지가 대표성을 결정합니다.

3

확률표본추출

확률표본은 각 단위의 포함확률을 알거나 계산할 수 있어 설계기반 가중치와 표준오차를 구할 수 있습니다.

방법선택 방식장점주의점
단순무작위개체별 동일확률추론 단순완전한 명단 필요
층화층별 독립 추출희귀층 정밀도가중치 필요 가능
군집학교·지역 등 집단 추출현장비용 절감집단 내 유사성
계통임의 시작 후 k번째운영 간단주기성과 간격 충돌
4

비확률 표본

편의표본, 자발적 응답, 눈덩이표본과 할당표본은 빠르고 접근 어려운 집단 연구에 유용하지만 선택확률을 알 수 없어 대표성 추론이 어렵습니다.

응답자 수가 커져도 자기선택 편향은 사라지지 않습니다. 서비스 불만이 매우 크거나 만족한 고객만 리뷰에 참여하면 평균 만족도는 모집단과 다릅니다.

가중·성향보정은 관측된 특성 차이를 줄일 수 있지만 표본틀에 없는 집단과 미관측 선택원인은 보장하지 못합니다. 표본의 구성과 적용 한계를 명시합니다.

5

층화와 희귀집단

희귀하지만 중요한 집단을 충분히 확보하려고 층별로 다른 비율을 추출할 수 있습니다. 전체 1%인 사기 사례를 20%로 과대표집하면 모델이 패턴을 학습하기 쉬워집니다.

모집단 비율과 평균을 추정할 때는 선택확률의 역수 등 표본가중치를 사용해야 합니다. 과대표집된 데이터를 그대로 쓰면 사기율을 20%로 잘못 추정합니다.

정밀도는 전체 n보다 층별 사례 수에 좌우됩니다. 각 층의 최소 표본, 설계효과, 비응답과 비용을 함께 계획합니다.

6

학습·검증·테스트

학습셋은 계수와 모델 매개변수, 검증셋은 특성·알고리즘·하이퍼파라미터·임계값 선택, 테스트셋은 모든 선택을 끝낸 뒤 최종 일반화 성능 평가에 사용합니다.

테스트 점수를 보고 모델을 고쳐 다시 확인하면 테스트셋도 검증셋이 됩니다. 최종 테스트를 잠그고 평가 횟수와 접근권한을 관리합니다.

데이터가 작으면 교차검증으로 개발 성능을 평가하되 전처리와 선택을 각 폴드 안에서 반복합니다. 선택이 많은 경우 nested CV로 선택과 최종 평가를 분리합니다.

7

층화 분할

불균형 분류에서 각 분할의 클래스 비율을 비슷하게 유지하면 검증셋에 양성이 거의 없는 우연을 줄입니다. 연속형 결과도 구간화해 대략 층화할 수 있지만 과도한 구간은 실패할 수 있습니다.

희귀 양성이 10개뿐이면 20% 테스트에는 평균 2개만 들어가 정확도·재현율이 매우 불안정합니다. 더 큰 표본, 반복 층화 CV와 불확실성 구간이 필요합니다.

층화는 분포를 인위적으로 맞추는 평가 설계입니다. 실제 배포 유병률이 다르면 확률보정과 성능지표 해석을 별도로 확인합니다.

8

그룹 분할

같은 환자·고객·장비·가구의 여러 행은 한 분할에 함께 둡니다. 행 단위 무작위 분할은 모델이 개인 식별패턴을 기억해 신규 개체 성능을 과대평가합니다.

신규 병원에 배포한다면 병원 단위 leave-one-group-out 평가가 필요하고, 기존 환자의 미래 방문을 예측한다면 환자 내부 시간분할이 질문에 맞을 수 있습니다.

그룹 수가 적거나 크기가 매우 불균형하면 폴드 성능 변동이 큽니다. 행 수뿐 아니라 그룹 수와 그룹별 결과 분포를 보고합니다.

9

시간 분할

미래 예측은 과거로 학습하고 그 이후 기간으로 검증·테스트합니다. 무작위 분할은 미래 계절, 정책과 사용자 상태를 과거 학습에 섞어 구조변화를 숨깁니다.

rolling-origin 평가는 학습창을 확장하거나 이동하며 여러 예측시점에서 성능을 반복 측정합니다. 운영에서 재학습 주기와 예측수평을 그대로 재현할 수 있습니다.

결과 라벨이 30일 뒤 확정된다면 분할 경계 주변 행의 라벨기간이 겹칠 수 있습니다. gap·embargo·purging으로 학습과 검증 정보중첩을 막습니다.

10

분할 후 전처리

결측대체, 스케일링, 인코딩, 변수선택, PCA, SMOTE는 모두 훈련자료에서만 fit하고 검증·테스트에는 transform만 합니다.

교차검증에서는 이 전 과정을 각 폴드 안에서 새로 실행해야 합니다. 전체 데이터에 한 번 전처리한 뒤 폴드만 나누면 검증정보가 변환에 들어갑니다.

분할 자체보다 이후 데이터 경계를 끝까지 유지하는 것이 중요합니다. 파이프라인 객체와 point-in-time 특성 생성으로 사람이 순서를 바꾸기 어렵게 만듭니다.

11

직접 해보기

테스트셋의 양성 사례 수에 따라 재현율 한 건의 변화가 점수를 얼마나 움직이는지 확인하세요.

표본추출·데이터 분할 인터랙티브 랩

표본을 다시 뽑고 표본 크기를 바꾸며 추정량의 흔들림과 구간 폭을 직접 비교하세요.

모집단 평균표본평균

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

계산 결과

20% 테스트의 양성 약 8개

양성 한 건의 분류가 바뀌면 재현율이 약 12.5%p 움직입니다. 희귀 결과에는 단일 분할 점수와 함께 반복평가·구간이 필요합니다.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

12

핵심 정리

  • 목표모집단·표본틀·응답표본의 차이를 구분합니다.
  • 층화·군집·계통 추출은 비용과 대표성의 균형이 다릅니다.
  • 학습·검증·테스트의 역할을 분리하고 테스트는 마지막에 사용합니다.
  • 개체반복·시간·희귀클래스 구조에 맞춰 분할합니다.
  • 전처리와 선택은 분할 뒤 학습자료에만 적합합니다.
13

더 깊이 알아보기

주제핵심 내용
Survey Weight기본 선택확률의 역수에 비응답·사후층화 보정을 더해 모집단 구성을 맞추며 복합설계에 맞는 분산추정을 사용합니다.
Covariate Shiftp(x)는 달라지지만 p(y|x)는 같다는 가정 아래 학습과 배포 입력분포 차이를 중요도가중으로 조정합니다.
External Validation다른 기관·지역·기간과 수집시스템에서 성능·보정·집단별 오류를 평가해 적용 범위를 확인합니다.
다음 학습데이터 누수는 여기서 설계한 표본·시간·그룹·테스트 경계를 넘어 사용할 수 없는 정보가 학습에 들어가는 모든 경로입니다.
다음: 데이터 누수