Blog/탐색적 데이터 분석(EDA)

통계

탐색적 데이터 분석(EDA)

모든 데이터셋의 첫 시선

SK

Skari Team

Skari

2026년 7월·14분

기술통계

중심(평균·중앙값), 퍼짐(표준편차), 모양이 검정 전에 분포를 요약합니다.

평균중앙값

잘못된 결론에 이르는 가장 빠른 길은 한 번도 보지 않은 데이터를 모델링하는 것입니다. 몰래 텍스트인 열, 절반이 빈 지표, 긴 꼬리를 가진 분포 — 이 중 무엇도 스스로를 알리지 않습니다. 먼저 보지 않으면 그것들은 그 위에 세운 모든 검정과 모델을 조용히 편향시킵니다.

탐색적 데이터 분석이 그 첫 시선입니다. 하나의 기법이 아니라 빠르고 구조화된 점검의 family — 각 열을 기술하고, 범주를 세고, 무엇이 상관되는지 보는 — 로, 방법을 확정하기 전에 원시 표를 이해할 수 있는 무언가로 바꿉니다.

Note

EDA는 분석에서 가장 저렴한 보험입니다. 데이터를 기술하는 몇 분이 검토하지 않은 열의 산물이었던 결과를 쫓는 몇 시간을 막습니다.

탐색의 세 질문

  1. 1각 열은 무엇인가? 타입, 얼마나 완전한지, 생각하는 것을 담고 있는지.
  2. 2각 값은 어떻게 퍼져 있나? 중심, 퍼짐, 모양 — 대칭인가 치우쳤나, 봉우리가 하나인가 여럿인가.
  3. 3무엇이 무엇과 움직이나? 어떤 변수가 함께 오르내리고, 어디를 더 들여다볼 가치가 있는가.

이것들에 답하면 단 하나의 가설을 검정하기 훨씬 전에 데이터셋 전체의 모습이 또렷해집니다.

기술: 중심, 퍼짐, 모양

기술통계는 위 히스토그램처럼 수치 열을 세 숫자어치 의미로 요약합니다 — 어디에 중심을 두고, 얼마나 퍼지고, 어떤 모양을 취하는지.

질문강건한 측도고전적 측도
중심중앙값평균
퍼짐IQR표준편차
모양왜도 / 이상치 플래그

평균과 중앙값이 벌어지면 열은 치우친 것이고 중앙값이 정직한 요약입니다. 기술통계 가이드가 각각을 언제 믿을지 다룹니다.

세기: 빈도분석

숫자에는 분포가, 범주에는 빈도가 있습니다. 빈도분석은 각 범주가 얼마나 자주 나오는지 세어 — 지배적 클래스, 모델을 괴롭힐 드문 수준, 정확도를 조용히 왜곡하는 불균형을 드러냅니다.

  • 모델이 그냥 외워버릴 수 있는 지배적 범주
  • 원-핫 인코딩을 깨거나 집단을 얇게 만드는 드문 수준
  • 클래스 불균형 — 정확도가 훌륭해 보이면서 아무 의미 없을 수 있는 이유

연관: 상관분석

각 열을 홀로 이해한 뒤, 탐색은 그것들이 어떻게 함께 움직이는지 묻습니다. 상관은 선형 관계의 강도와 방향을 측정해 더 깊이 볼 가치가 있는 쌍을 표시합니다.

Watch out

상관은 출발점이지 결론이 아닙니다. 강한 계수가 인과를 증명하는 일은 결코 없습니다 — 조사할 관계를 표시할 뿐입니다. 상관 vs 인과 가이드가 이유와 사람을 속이는 교란변수를 다룹니다.

EDA가 이끄는 곳

탐색은 그 자체가 목적이 아닙니다 — 이후 모든 결정을 준비합니다. 발견한 것이 올바른 다음 단계로 안내합니다.

EDA가 드러내는 것가리키는 곳
왜도나 이상치변환, 또는 강건·비모수 방법
결측값의도적인 대치 또는 삭제
강한 상관회귀, 또는 차원 축소
집단 차이비교 검정(t검정, ANOVA)

SKARI Statistical Lab의 탐색

SKARI는 탐색을 첫 분석 family로 다룹니다 — 비교·관계·예측 작업 전의 출발점. 데이터 편집기와 Statistical Lab이 방법을 확정하기 전에 프로파일링하고 요약합니다.

  • 열별 기술통계 — 중심, 퍼짐, 모양, 이상치 플래그
  • 범주형 열의 빈도분석과 클래스 균형
  • 계수와 유의성을 갖춘 상관분석
  • 타입·완전성 문제를 먼저 잡는 데이터 편집기의 열 프로파일링

Takeaway

데이터의 전체 그림 — 타입, 분포, 관계 — 에서 시작합니다. 그래서 이후 모든 분석이 추측이 아니라 계획입니다.

자주 묻는 질문

EDA는 그냥 차트 만드는 건가요?

차트가 돕지만, EDA는 모든 변수를 기술·계수·연관하는 구조화된 습관입니다 — 그림만 그리는 게 아니라 데이터를 이해하는 것.

EDA는 얼마면 충분한가요?

세 질문 — 각 열이 무엇이고, 어떻게 퍼졌고, 무엇이 상관되는지 — 에 답하고, 계획한 방법을 무효화할 것을 잡을 만큼입니다.

언제 탐색을 멈추고 검정을 시작하나요?

데이터에 선택한 분석을 깨뜨릴 놀라움이 더는 없을 때. 끝나지 않는 EDA는 미루기이고, 건너뛴 EDA는 함정입니다.

핵심 요약

기술

중심·퍼짐·모양

세기

클래스

빈도·균형

연관

상관

그다음

선택

올바른 방법

탐색은 원시 표를 이해로 바꿉니다. 각 열을 기술하고, 범주를 세고, 무엇이 상관되는지 보면 — 무엇을 돌리기 전에 올바른 검정·변환·모델이 이미 절반은 정해집니다.

Takeaway

모델링 전에 보세요. 몇 분의 탐색이 방어할 수 있는 결과와 애초에 산물이었던 결과의 차이입니다.

기술통계

중심, 퍼짐, 모양을 깊이

상관 ≠ 인과

관계를 올바르게 읽기

열 프로파일링

데이터 품질 첫 점검