배우기
인터랙티브·

이상치 탐지

극단적인 관측값의 원인과 영향 구분하기

1

들어가며

월 매출 5억 원인 고객 한 명은 입력 오류일 수도 있지만 사업을 떠받치는 핵심 고객일 수도 있습니다.

이상치는 다른 관측과 멀리 떨어진 값이라는 기술적 표시입니다. 오류, 다른 모집단, 드문 정상 사례, 구조 변화 중 무엇인지는 탐지 알고리즘만으로 결정할 수 없습니다.

값이 극단적인 것과 분석 결과를 크게 바꾸는 것도 다릅니다. 탐지→원인 확인→영향 평가→처리→민감도 분석을 분리해야 희귀한 정보를 자동으로 지우지 않습니다.

핵심 질문

이 관측은 왜 특이하며, 유효한가, 어느 분석 결과를 얼마나 바꾸는가?

단변량 이상치

거리

중앙값·IQR·MAD를 기준으로 멀리 떨어진 값을 찾습니다.

다변량 이상치

조합

각 변수는 평범해도 변수 조합이 드문 관측을 확인합니다.

영향점

결과 변화

제거 전후 계수와 결론이 얼마나 달라지는지 민감도를 봅니다.

2

이상치 유형

같은 관측이 여러 유형일 수 있지만 극단값이 항상 영향점은 아니고, 눈에 띄지 않는 점도 고레버리지 때문에 영향점이 될 수 있습니다.

유형예시확인 방법
단변량한 변수에서 극단키 250cm분포·원문서
다변량조합이 드묾신입인데 경력 30년산점도·거리
조건부맥락에서 비정상겨울 35℃집단·시간 기준
영향점추정치를 크게 이동회귀 끝점Cook·DFBETAS
3

IQR 기준

Q1−1.5IQR 아래 또는 Q3+1.5IQR 위를 상자그림의 후보점으로 표시합니다. 중앙 50%를 사용해 극단값 자체에 덜 민감하고 분포 가정이 적습니다.

정규분포에서도 표본이 커지면 경계 밖 점이 자연스럽게 나타납니다. 긴 꼬리·비대칭 분포에서는 한쪽에 많은 정상값이 표시될 수 있어 로그변환이나 집단별 기준을 검토합니다.

하한=Q11.5IQR,상한=Q3+1.5IQR\text{하한}=Q_{1}-1.5IQR, \text{상한}=Q_{3}+1.5IQR
1.5는 오류확률을 보장하는 임계값이 아니라 탐색용 관례입니다.
4

z점수와 수정 z점수

일반 z점수는 평균과 SD를 사용하므로 극단값이 평균을 끌고 SD를 키워 자기 자신이 덜 극단적으로 보이는 masking이 생길 수 있습니다. 여러 극단값이 서로를 숨기기도 합니다.

수정 z점수는 중앙값과 MAD를 사용해 더 강건합니다. 다만 MAD=0인 반올림·희소 자료에서는 계산이 불안정하고, 정규성이 없는 분포에 하나의 절단값을 기계 적용해서는 안 됩니다.

Mi=0.6745(ximedian)/MADM_{i}=0.6745(x_{i}-\operatorname{median})/MAD
|M|>3.5는 흔한 검토 기준이지만 도메인·표본크기·분포와 함께 판단합니다.
5

시각화

히스토그램과 ECDF는 전체 꼬리, 상자그림은 강건한 경계, 산점도는 두 변수 조합, 시간그래프는 특정 시점의 충격과 구조변화를 보여줍니다.

집단을 섞으면 한 집단의 정상값이 전체 이상치처럼 보일 수 있습니다. 지역·상품·성별·센서별로 색상 또는 패널을 나눠 조건부 분포를 확인합니다.

로그축은 넓은 범위를 압축해 패턴을 보이지만 원단위의 실제 차이를 숨길 수 있습니다. 원단위와 로그척도 그래프를 함께 확인하고 점의 식별자를 추적 가능하게 유지합니다.

6

다변량 이상치

각 변수는 정상범위여도 조합이 비정상일 수 있습니다. 키 170cm와 체중 70kg은 각각 평범하지만 나이 5세와 결합되면 검토가 필요합니다.

Mahalanobis 거리는 변수 간 공분산을 반영한 타원형 거리입니다. 고전 공분산이 이상치에 끌릴 수 있어 robust covariance를 사용하기도 하며, 범주형·비선형 구조에는 부적합할 수 있습니다.

LOF는 주변보다 밀도가 낮은 점, Isolation Forest는 적은 분할로 고립되는 점을 찾습니다. 스케일, 이웃 수, 오염비율, 고차원 거리집중에 따라 결과가 달라지므로 라벨 있는 검증 사례가 중요합니다.

7

영향력 진단

회귀에서 잔차는 y방향으로 모형과 다른 정도, leverage는 x공간에서 멀리 있는 정도입니다. 둘이 함께 크면 회귀선을 강하게 움직일 가능성이 큽니다.

Cook 거리는 한 관측을 제외했을 때 전체 적합값이 얼마나 바뀌는지, DFBETAS는 특정 계수가 얼마나 바뀌는지 보여줍니다. 흔한 4/n 기준은 검토 시작점이지 자동 삭제 규칙이 아닙니다.

결과변수가 평범해도 x범위 끝의 점은 기울기를 고정할 수 있습니다. 반대로 y가 극단적이어도 x중앙에 있는 점은 잔차는 크지만 기울기 영향은 제한적일 수 있습니다.

8

원인 확인

입력오류, 소수점 위치, 단위혼합, 중복, 센서고장, 조인 폭증, 코드 변경인지 원문서와 수집로그를 확인합니다. 수정 가능한 오류라면 추정값으로 덮기보다 근거 있는 원값으로 교정합니다.

유효한 극단 사례는 별도 집단, 계절적 사건, 신규 상품, 실제 두꺼운 꼬리일 수 있습니다. 모집단 정의에 포함되는 사례라면 제외가 오히려 위험을 과소평가합니다.

여러 규칙이 같은 행을 표시하는지, 특정 날짜·담당자·기기에서 몰리는지 봅니다. 개별 값보다 생성과정의 체계적 오류가 더 중요한 경우가 많습니다.

9

처리 방법

결과가 마음에 들 때까지 임계값을 바꾸면 연구자 자유도가 커집니다. 처리 기준을 가능한 한 결과 확인 전에 정하고 원자료 결과를 함께 제시합니다.

처리적합한 상황주의점
원값 수정원문서로 오류 확인수정 근거 보존
제외대상 모집단 밖·복구 불가 오류사전 기준·건수 보고
변환유효한 오른쪽 꼬리·배율관계해석·역변환 변경
Winsorize극단 영향 제한이 설계상 필요꼬리정보 손실
강건 모형유효 극단값을 보존추정대상 차이 확인
10

민감도 분석

원자료, 확인된 오류 수정, 강건 추정, 사전 기준 제외 결과를 비교해 결론이 특정 관측에 의존하는지 봅니다. 평균 차이뿐 아니라 계수, 순위, 예측오차와 신뢰구간 변화를 확인합니다.

한 점을 제거했을 때 부호가 바뀌거나 유의성만 크게 변하면 “제외 후 유의”가 아니라 결론이 불안정하다고 보고합니다. leave-one-out 영향 그래프가 유용합니다.

제외된 사례 수와 특성, 처리 규칙, 결과 변화와 최종 선택 이유를 투명하게 보고합니다. 실제 운영에서는 삭제하지 않고 별도 경보·전문가 검토 대상으로 라우팅할 수도 있습니다.

11

직접 해보기

평균이 50인 기존 자료에 관측 하나를 추가할 때 새 평균이 얼마나 이동하는지 확인하세요.

이상치 탐지 인터랙티브 랩

데이터 문제의 양과 처리 강도를 바꾸며 남는 정보와 왜곡이 어떻게 달라지는지 비교하세요.

처리 전처리 후진한 셀은 아직 남은 문제

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

계산 결과

새 평균 95.0 · 이동 +45.0

관측 하나의 평균 가중치는 1/10입니다. 표본이 작고 값이 멀수록 영향이 커지지만 오류 여부는 별도 확인해야 합니다.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

12

핵심 정리

  • 이상치는 극단값·다변량 조합·조건부 이상·영향점으로 구분합니다.
  • IQR·z·MAD 기준은 검토 플래그이며 자동 삭제 규칙이 아닙니다.
  • 원문서와 생성과정으로 오류·유효 극단값을 구분합니다.
  • 수정·제외·변환·강건 모형의 근거를 기록합니다.
  • 처리 전후 민감도 분석으로 결론의 의존성을 확인합니다.
13

더 깊이 알아보기

주제핵심 내용
강건 공분산Minimum Covariance Determinant는 일부 관측의 공분산으로 중심과 산포를 강건하게 추정해 Mahalanobis 거리의 masking을 줄입니다.
Quantile Regression조건부 평균 대신 중앙값·상위분위수를 모형화해 꼬리와 이분산을 결과의 일부로 분석합니다.
Extreme Value Theory극단값을 제거하지 않고 임계값 초과나 블록 최대값의 꼬리분포를 모델링해 희귀위험의 빈도와 크기를 추정합니다.
다음 학습데이터 변환은 유효한 극단값을 삭제하지 않고 비대칭·비선형·분산 불균형을 다른 척도에서 다루는 방법입니다.
다음: 데이터 변환·로그변환