배우기
인터랙티브·

결측치 처리

비어 있는 이유를 이해하고 불확실성을 보존하기

1

들어가며

소득이 비어 있는 사람을 모두 평균소득으로 채우면 데이터는 완성되지만 사실은 더 틀릴 수 있습니다.

고소득자가 사생활 때문에 응답하지 않았다면 빈칸은 무작위가 아닙니다. 결측은 값이 없다는 사실뿐 아니라 어떤 사람이 어떤 상황에서 측정되지 않았는지를 담고 있습니다.

평균대체는 표본 수를 유지하지만 값의 분산을 줄이고 변수 간 관계를 약화합니다. 먼저 결측 표현, 규모, 패턴과 발생과정을 진단한 뒤 삭제·단순대체·다중대체·가중·모형 처리를 선택합니다.

핵심 질문

왜 비었으며, 결측될 확률은 이미 관측한 정보 또는 보이지 않는 실제 값과 어떻게 관련되는가?

결측 패턴

어디가 비었나

변수별 비율과 행·집단·시간에 따른 누락 패턴을 봅니다.

발생 메커니즘

MCAR·MAR·MNAR

결측이 관측값이나 미관측값과 어떻게 연결되는지 판단합니다.

처리와 민감도

삭제·대치

단일 선택에 의존하지 않고 여러 가정에서 결과를 비교합니다.

2

결측 표현 통일

빈 문자열, 공백, NA, null, 999, −1, “모름”, “응답 거부”, “해당 없음”을 구분합니다. 모두 하나의 NA로 합치면 결측 원인과 분석 분모가 사라집니다.

0은 실제로 없음인지 미입력 기본값인지 확인합니다. 구매횟수 0은 유효하지만 체중 0kg는 결측 또는 오류일 가능성이 높습니다.

원자료 코드는 보존하고 분석용 결측값과 결측 사유 변수를 따로 만듭니다. 구조적 결측인 “비흡연자의 흡연량”은 조사 누락과 다른 의미입니다.

3

결측률과 패턴

변수별·행별 결측률, 동시에 비는 변수 조합, 결측이 시작된 시점과 집단별 차이를 봅니다. 한 설문 페이지의 모든 문항이 함께 비면 페이지 이탈이나 분기 로직 문제일 수 있습니다.

전체 결측률이 5%여도 핵심 고령층에서 40%라면 평균은 문제를 숨깁니다. 결측 여부를 결과로 두고 연령·지역·채널과의 관계를 탐색하면 선택 패턴을 찾을 수 있습니다.

완전사례 수를 분석별로 계산합니다. 변수마다 10%씩 독립적으로 비면 변수 10개가 모두 관측될 비율은 약 0.9¹⁰=35%에 불과할 수 있습니다.

4

MCAR·MAR·MNAR

MAR는 “결측이 무작위”라는 뜻이 아니라 관측된 정보를 조건으로 하면 설명된다는 뜻입니다.

결측 기제는 데이터만으로 완전히 증명할 수 없습니다. 설문 분기, 장비 로그, 응답자 인터뷰와 도메인 지식이 필요하며 MNAR 가능성은 민감도 분석으로 다룹니다.

기제결측될 확률이 의존하는 것예시주요 대응
MCAR관측·미관측 값과 무관표본 일부의 무작위 장비고장삭제도 불편성 유지 가능
MAR관측된 다른 변수연령에 따른 소득 미응답관측변수 포함 대체·가중
MNAR결측된 실제 값 또는 미관측 원인고소득일수록 소득 거부민감도·선택모형
5

완전사례 삭제

분석에 필요한 변수 중 하나라도 결측이면 해당 행을 제외합니다. 구현이 단순하고 결측이 드문 MCAR 상황에서는 타당할 수 있지만 표본과 검정력이 줄어듭니다.

MAR나 MNAR에서 관측된 사람만 남기면 모집단 구성이 바뀝니다. 고령자가 건강문항을 더 많이 건너뛰면 완전사례 평균은 더 젊고 건강한 집단을 대표할 수 있습니다.

분석마다 필요한 변수가 달라 표본이 바뀌면 모형 간 계수 차이가 변수 추가 때문인지 표본 변경 때문인지 구분하기 어렵습니다. 공통 분석표본 결과도 함께 비교합니다.

6

단순 대체

평균·중앙값·최빈값 대체는 빠르고 예측 파이프라인의 기준선으로 유용합니다. 그러나 같은 값을 반복 삽입해 분산을 작게 만들고 공분산·상관·표준오차를 왜곡합니다.

집단별 평균대체는 집단 차이를 강제로 보존하거나 과장할 수 있고, 회귀대체는 예측선 위에 값을 놓아 관계를 지나치게 강하게 만듭니다. 대체값을 실제 관측처럼 취급한 추론은 불확실성을 과소평가합니다.

훈련·검증 문제에서는 대체 통계량을 훈련 폴드에서만 계산합니다. 전체 자료의 중앙값으로 테스트를 채우면 미래 분포 정보가 훈련 과정에 들어갑니다.

7

결측 지표

대체값과 함께 원래 결측 여부를 0/1 변수로 넣으면 “측정되지 않았음” 자체의 예측정보를 보존할 수 있습니다. 병원검사가 주문되지 않았다는 사실이 환자 상태나 의사 판단을 반영할 수 있습니다.

결측지표 계수는 생물학적 효과가 아니라 측정·운영 과정의 효과일 수 있습니다. 정책이나 시스템이 바뀌면 의미가 달라져 배포 성능이 떨어질 수 있습니다.

추론에서 결측지표 방식이 자동으로 편향을 해결하지는 않습니다. 예측 성능과 인과·모수 추정의 타당성을 구분합니다.

8

다중대체

결측값을 하나로 고정하지 않고 관측정보에 조건부인 여러 가능한 값을 뽑아 m개의 완성자료를 만듭니다. 각 자료에서 같은 분석을 수행한 뒤 Rubin 규칙으로 추정치와 분산을 결합합니다.

전체 불확실성은 각 완성자료 안의 분석 분산과 완성자료 사이 추정치 변동을 합칩니다. 결측이 많을수록 대체자료 간 차이가 커져 표준오차에 반영됩니다.

T=W+(1+1/m)BT = W + (1+1/m)B
W는 대체자료 내부 분산, B는 대체자료 간 추정치 분산입니다.
9

시간·집단 자료

전방채움은 마지막 값이 다음 측정까지 유지된다는 가정입니다. 재고상태에는 가능할 수 있지만 체온·주가·증상점수에는 부적절할 수 있습니다. 미래값으로 과거를 뒤채우면 예측 누수입니다.

환자·매장 같은 집단별 대체는 집단 구조를 보존하지만 관측이 적은 집단에서는 불안정하고 신규 집단에는 적용할 값이 없습니다. 다층 대체모형은 집단 내·집단 간 변동을 함께 반영합니다.

시계열에서 단순 선형보간은 관측 사이의 부드러운 경로를 가정합니다. 긴 공백과 급격한 변화 구간에서는 실제 변동성을 과도하게 낮춥니다.

10

민감도 분석

완전사례, 단순대체, 다중대체 결과의 효과크기·표준오차·결론을 비교합니다. 방법마다 표본과 가정이 다르므로 p값만 나열하지 말고 왜 달라졌는지 설명합니다.

MNAR 가능성에서는 대체된 소득을 10%·20% 높이거나 낮추는 delta adjustment처럼 그럴듯한 범위를 움직여 결론이 언제 바뀌는지 봅니다.

결측률, 결측 사유, 사용한 보조변수, 대체모형, 대체 횟수, 수렴 진단과 민감도 결과를 보고해야 분석을 재현할 수 있습니다.

11

직접 해보기

여러 변수가 각각 같은 비율로 독립적으로 결측일 때 완전사례가 얼마나 빠르게 줄어드는지 확인하세요.

결측치 처리 인터랙티브 랩

데이터 문제의 양과 처리 강도를 바꾸며 남는 정보와 왜곡이 어떻게 달라지는지 비교하세요.

처리 전처리 후진한 셀은 아직 남은 문제

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

계산 결과

1,000명 중 완전사례 약 349명

독립 결측 가정에서 관측비율은 (1−0.10)^10=34.9%입니다. 실제 결측이 함께 발생하면 달라집니다.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

12

핵심 정리

  • 결측코드와 유효한 0·모름 응답을 먼저 구분합니다.
  • 변수·행·집단·시간별 결측 패턴을 확인합니다.
  • MCAR·MAR·MNAR 가정에 따라 편향 위험이 달라집니다.
  • 단순대체는 분산·상관을 왜곡하며 다중대체는 불확실성을 반영합니다.
  • 대체는 학습 폴드 안에서 수행하고 방법별 민감도 분석을 보고합니다.
13

더 깊이 알아보기

주제핵심 내용
MICE각 결측변수를 다른 변수들로 조건부 예측하는 과정을 순환하며 여러 대체자료를 만들고 변수 유형에 맞는 모형을 사용합니다.
IPW관측될 확률을 추정해 그 역수로 가중함으로써 관측되기 어려운 사례를 더 대표하게 하지만 극단가중치와 모형 오류에 민감합니다.
Pattern-mixture결측 패턴별 결과분포를 모델링하고 식별되지 않는 차이에 가정을 두어 MNAR 민감도를 분석합니다.
다음 학습이상치 탐지는 비어 있는 값이 아니라 지나치게 멀리 있는 값이 오류·다른 집단·중요한 신호 중 무엇인지 구분합니다.
다음: 이상치 탐지