데이터 분석·통계·머신러닝에 관한 심층 가이드 — 기초 원리부터 실무 적용까지.
53개의 글
통계 · 추천
K-Means, DBSCAN, SOM까지 모든 군집분석 알고리즘을 완벽하게 이해하고, 거리 측정 방법, 하이퍼파라미터 설정, SKARI 플랫폼 활용까지 배워보세요.
K-Means · k=3
K-Means는 점들을 k개 그룹으로 나누고, 각 그룹을 중심점으로 요약합니다.
Model Lab
K-Means를 넘어서. 앙상블(합의) 클러스터링, 소프트/확률 기반 할당, 밀도·계층 기법, 그리고 군집을 제대로 평가하는 방법을 배워보세요.
합의
여러 번 실행하는 동안 각 점 쌍이 같은 군집에 묶인 빈도입니다. 짙은 블록이 앙상블이 합의한 안정적인 군집입니다.
Model Lab
선형 회귀가 실제로 알려주는 것 — 단순 vs 다중, 출력 읽는 법, 네 가지 가정, 그리고 조용히 오해를 부르는 실수.
R² ≈ 0.8
회귀는 모든 점까지의 제곱 거리를 최소화하는 직선을 찾습니다.
Model Lab
주요 분류기가 어떻게 다른지, 무엇을 꺼내들지, 정말 중요한 지표, 그리고 불균형 데이터에서 정확도만으로 오해하는 이유.
정확한 예측은 대각선(TP, TN)에, 대각선 밖은 오류입니다.
Model Lab
모델이 학습이 아니라 암기하는 이유 — 편향-분산 트레이드오프, 과적합을 알아채는 법, 그리고 Ridge·Lasso 규제로 고치는 법.
복잡도
학습 오차는 계속 낮아지지만 검증 오차는 다시 오릅니다. 그 격차가 과적합이고, 최적점은 최저점입니다.
Model Lab
의사결정나무가 한 번에 한 질문씩 학습하는 원리 — 지니와 엔트로피, 깊은 나무가 과적합하는 이유, 그리고 가지치기와 숲으로 고치는 법.
각 분기는 하나의 예/아니오 질문으로 데이터를 나누고, 잎에 예측이 남을 때까지 반복합니다.
Model Lab
부스팅이 나무를 순차적으로 지어 각각 이전을 바로잡는 원리 — XGBoost와 LightGBM이 정형 데이터를 지배하는 이유, 그리고 중요한 설정.
새 나무마다 이전 오차를 바로잡아 — 잔차가 라운드마다 줄어듭니다.
Model Lab
단일 학습/테스트 분할이 거짓말할 수 있는 이유, k-겹 교차검증이 안정적 추정을 주는 방법, 그리고 모든 점수를 조용히 부풀리는 누수.
데이터를 k개 겹으로 나눠, 각 겹이 차례로 검증 세트가 되고 나머지가 학습합니다.
Model Lab
파라미터와 하이퍼파라미터의 차이, 그리드·랜덤 탐색이 최적점을 찾는 법, 그리고 검증 곡선이 튜닝 자체의 과적합을 막는 이유.
학습 오차는 계속 내려가지만 검증 오차는 바닥을 치고 오릅니다 — 과적합 직전의 최적점.
Model Lab
주성분분석이 상관된 많은 열을 몇 개로 압축하는 방법, 성분의 의미, 스케일링이 중요한 이유, 그리고 언제 쓸지.
PCA는 분산이 가장 큰 축을 찾습니다 — 긴 화살표(PC1)가 퍼짐의 대부분을 담습니다.