중복 행은 하류의 모든 것을 조용히 왜곡합니다: 개수를 부풀리고, 모델에서 반복 레코드에 과한 가중치를 주고, 집계를 깨뜨립니다. 위 차트가 반복을 표시하지만 — 삭제 전에 어떤 종류의 중복인지 알아야 합니다.
Note
완전 중복 vs 근사 중복
- 완전 중복: 모든 필드가 일치 — 대개 안전한 제거
- 키 중복: 같은 식별자가 반복, 다른 필드는 다를 수 있음
- 근사 중복: 'Jon Smith' vs 'John Smith' — 같은 개체, 지저분한 텍스트
완전 중복은 쉽습니다. 근사 중복은 텍스트가 다르므로 먼저 퍼지 매칭이나 정규화가 필요합니다 — 개체는 같아도.
어느 사본을 남길까
중복을 찾으면 삭제는 절반일 뿐 — 어느 행이 살아남을지 정해야 합니다. 데이터에 따라 가장 최근, 가장 완전, 또는 가장 신뢰할 출처의 것을 남기세요.
Watch out
과잉 삭제 위험
너무 적은 열로 중복 제거하면 겉만 비슷한 별개 레코드를 병합할 수 있습니다. 같은 날 같은 금액의 진짜 주문 둘이 반드시 하나는 아닙니다 — 키가 행을 진짜로 고유하게 만드는 것을 담는지 확인하세요.
SKARI 데이터 편집기의 중복 정리
데이터 편집기의 정리 도구는 반복을 검사하고 제거하도록 돕습니다: 열의 반복 값을 프로파일링하고, 실행 전 행을 검토하고, 되돌릴 수 있는 추적 단계로 제거를 적용합니다.
- 열 프로파일링으로 반복 값 발견
- 무엇이 삭제되기 전 표시된 행 검토
- 파이프라인에 기록되고 되돌릴 수 있는 모든 정리 단계
Takeaway
자주 묻는 질문
항상 중복을 제거해야 하나요?
아니요 — 행이 정말 반복되면 안 될 때만. 일부 반복(재구매, 반복 측정)은 진짜 데이터입니다.
근사 중복은 어떻게 잡나요?
먼저 텍스트를 정규화(대소문자, 공백, 형식)한 뒤 매칭 — 퍼지 매칭이 나머지를 잡습니다.
어느 행이 이겨야 하나요?
대개 가장 최근이나 가장 완전한 것 — 단, 출처에 따라 규칙을 의도적으로 정하세요.
결론
중복 탐지는 하류의 모든 개수와 모델을 보호합니다 — 단, 진짜 중복을 정당한 반복과 구별하고, 살아남을 행을 의도적으로 고르고, 되돌릴 여지를 남길 때만. 반사적으로가 아니라 의도적으로 정리하세요.
Takeaway
결측 데이터 다루기
데이터 정리의 다른 절반
데이터셋 조인
중복이 자주 스며드는 곳
열 프로파일링
반복을 한눈에 발견