모든 정리 결정 — 대치할지 버릴지, 인코딩할지 구간화할지, 스케일링할지 둘지 — 는 먼저 열을 아는 데 달렸습니다. 프로파일링이 그 첫 시선입니다: 위 채움률 막대가 시사하듯, 각 열이 실제로 무엇을 담는지의 간결한 요약.
Note
프로파일이 보여주는 것
- 타입: 정말 수치인가, 아니면 텍스트로 저장된 숫자인가?
- 채움률: 얼마나 값이 있고 얼마나 결측인가
- 분포: 중심, 퍼짐, 모양을 한눈에
- 카디널리티: 고유값이 몇 개 — 범주 몇 개인가 수천 개인가?
- 요약과 모델을 왜곡할 이상치와 극단값
신호 읽기
각 프로파일은 할 일 목록입니다. 낮은 채움률은 결측 처리를 표시하고, 높은 카디널리티는 순진한 원-핫을 경고하고, 심한 왜도는 변환이나 강건한 요약을 가리키고, 잘못된 타입은 무엇보다 먼저 변환을 뜻합니다.
Tip
조용한 문제 잡기
프로파일링은 오류를 던지지 않는 문제를 드러냅니다 — 몰래 텍스트로 저장된 수치 열, 절반이 빈 "날짜" 필드, 사실 같은 값의 오타 백 개인 범주. 이런 것들은 프로파일이 보이게 만들 때까지 조용히 지나갑니다.
Watch out
SKARI 데이터 편집기의 프로파일링
데이터 편집기의 열 프로파일링은 데이터를 불러오는 순간 모든 열을 요약합니다: 타입, 채움률, 분포, 고유값 개수 — 정리를 시작하는 지도.
- 열별 타입, 채움률, 고유값 개수
- 분포 미리보기와 결측값 요약
- 다음 정리 단계를 가리키는 이상치·왜도 플래그
Takeaway
자주 묻는 질문
언제 프로파일링해야 하나요?
가장 먼저 — 어떤 정리나 모델링 전에. 이후 모든 것의 의제를 정합니다.
이건 그냥 EDA 아닌가요?
프로파일링은 탐색적 분석의 구조화된 열별 시작 — 더 깊은 탐색 전의 빠른 건강 점검입니다.
가장 흔한 놀라움은?
텍스트로 저장된 숫자, 그리고 예상보다 훨씬 빈 열. 둘 다 프로파일링이 드러낼 때까지 하류 단계를 조용히 깨뜨립니다.
결론
열 프로파일링은 정리를 추측에서 계획으로 바꿉니다. 타입, 채움률, 분포, 카디널리티를 먼저 읽으면 — 이후 모든 결정(대치, 인코딩, 스케일링, 구간화)이 데이터의 실제 모습 위에 섭니다.
Takeaway
결측 데이터 다루기
낮은 채움률에 대응하기
기술통계
프로파일 뒤의 통계
범주형 인코딩
카디널리티로 고르기