실제 군집분석을 하려고 코드를 짤 필요도, 어떤 알고리즘을 골라야 하는지 알 필요도 없습니다. 이 튜토리얼은 원본 스프레드시트에서 해석된 고객 세그먼트까지 다섯 단계로 안내합니다.
Note
1단계 · 데이터 업로드
CSV나 엑셀 파일을 끌어다 놓으세요. SKARI가 열을 읽고 각 타입을 추론하며, 제대로 파싱됐는지 확인할 수 있도록 미리보기를 보여줍니다.
- 지원 형식: CSV, 엑셀(.xlsx), 일반적인 데이터베이스 내보내기
- 각 행 = 하나의 레코드, 각 열 = 하나의 속성
- 헤더를 손으로 정리할 필요 없음 — 타입은 자동 감지
2단계 · 자동 전처리
대부분의 튜토리얼이 건너뛰고 대부분의 프로젝트가 틀리는 단계입니다. SKARI가 대신 처리합니다: 스케일링, 결측치, 인코딩 — 데이터에 fit하고 일관되게 적용합니다.
- 숫자형 변수는 표준화되어 한 열이 지배하지 않도록 함
- 결측치는 합리적인 전략으로 대치
- 범주형 열은 자동으로 인코딩
Tip
3단계 · 군집 방법 선택
알고리즘을 직접 고르거나, 데이터의 형태와 규모에 맞춰 SKARI가 추천하도록 두세요. 첫 프로젝트라면 자동 추천된 k를 쓰는 기본 K-Means가 든든한 출발점입니다.
- 군집 수를 모르겠다면? SKARI가 엘보우와 실루엣으로 k를 제안
- 노이즈나 이상한 형태가 예상되면? 클릭 한 번으로 HDBSCAN 전환
- 견고한 답을 원하면? 앙상블을 켜서 여러 방법을 결합
4단계 · 실행
실행을 누르세요. 결과가 몇 초 만에 나타납니다 — 군집 크기, 중심점, 그리고 탐색할 수 있는 산점도까지. 학습 스크립트를 기다릴 필요도, 환경을 세팅할 필요도 없습니다.
5단계 · 해석과 내보내기
마지막 단계가 이 모든 작업의 목적입니다: 군집이 무엇을 뜻하는지 이해하는 것. SKARI는 각 그룹을 프로파일링해서 이름 붙이고 실행에 옮길 수 있게 합니다.
군집분석
K-Means · k=3
K-Means는 점들을 k개 그룹으로 나누고, 각 그룹을 중심점으로 요약합니다.
- 각 군집의 프로필 확인 — 어떤 변수가 그 군집을 정의하는지
- 그룹을 의미 있게 이름 변경(VIP, 이탈 위험, 신규)
- 리포트를 내보내거나, 모델을 API로 배포해 재사용
Takeaway
자주 묻는 질문
데이터를 먼저 정규화해야 하나요?
아니요 — SKARI가 2단계에서 자동으로, 스케일러를 올바르게 fit해서 데이터 누수 없이 처리합니다.
군집 수를 모르면 어떻게 하나요?
SKARI가 k를 제안하도록 하세요. 여러 범위에서 엘보우와 실루엣을 평가해 조정 가능한 출발점을 추천합니다.
결과를 나중에 재사용할 수 있나요?
네. 학습된 모델을 API로 내보내 같은 군집화로 새 레코드를 분류할 수 있습니다.
결론
군집분석의 어려운 부분 — 스케일링, k 선택, 방법 비교 — 이 바로 SKARI가 자동화하는 부분입니다. 당신의 몫은 해석이고, 어차피 가치는 거기에 있습니다.
Takeaway
군집분석 완벽 가이드
버튼 뒤의 알고리즘을 이해하기
데이터 정규화 가이드
전처리가 결과를 좌우하는 이유
고급 군집분석 기법
더 까다로운 데이터를 위한 앙상블·다층 분석