Skari 블로그
EN

Skari 블로그

데이터 분석·통계·머신러닝에 관한 심층 가이드 — 기초 원리부터 실무 적용까지.

53개의 글

통계 · 추천

군집분석(Clustering) 완벽 가이드: K-Means부터 DBSCAN, SOM까지 한 번에 이해하기

K-Means, DBSCAN, SOM까지 모든 군집분석 알고리즘을 완벽하게 이해하고, 거리 측정 방법, 하이퍼파라미터 설정, SKARI 플랫폼 활용까지 배워보세요.

SKSkari Team·2026년 7월·18분
자세히 보기

군집분석

K-Means · k=3

K-Means는 점들을 k개 그룹으로 나누고, 각 그룹을 중심점으로 요약합니다.

그룹 1그룹 2그룹 3

Model Lab

고급 군집분석 기법: 앙상블 클러스터링과 다층 분석

K-Means를 넘어서. 앙상블(합의) 클러스터링, 소프트/확률 기반 할당, 밀도·계층 기법, 그리고 군집을 제대로 평가하는 방법을 배워보세요.

SKSkari Team·2026년 7월·13분
자세히 보기

동시 군집화 행렬

합의

여러 번 실행하는 동안 각 점 쌍이 같은 군집에 묶인 빈도입니다. 짙은 블록이 앙상블이 합의한 안정적인 군집입니다.

Model Lab

회귀분석 완벽 가이드: 계수, R², 잔차 읽는 법

선형 회귀가 실제로 알려주는 것 — 단순 vs 다중, 출력 읽는 법, 네 가지 가정, 그리고 조용히 오해를 부르는 실수.

SKSkari Team·2026년 7월·11분
자세히 보기

선형 회귀

R² ≈ 0.8

회귀는 모든 점까지의 제곱 거리를 최소화하는 직선을 찾습니다.

Model Lab

분류 모델 비교: 로지스틱, 트리, XGBoost

주요 분류기가 어떻게 다른지, 무엇을 꺼내들지, 정말 중요한 지표, 그리고 불균형 데이터에서 정확도만으로 오해하는 이유.

SKSkari Team·2026년 7월·11분
자세히 보기

혼동 행렬

정확한 예측은 대각선(TP, TN)에, 대각선 밖은 오류입니다.

82TP11FN14FP93TNPN예측 +예측 −

Model Lab

과적합과 규제: 편향, 분산, Ridge와 Lasso

모델이 학습이 아니라 암기하는 이유 — 편향-분산 트레이드오프, 과적합을 알아채는 법, 그리고 Ridge·Lasso 규제로 고치는 법.

SKSkari Team·2026년 7월·10분
자세히 보기

과적합

복잡도

학습 오차는 계속 낮아지지만 검증 오차는 다시 오릅니다. 그 격차가 과적합이고, 최적점은 최저점입니다.

최적 적합
검증 학습

Model Lab

의사결정나무 완벽 이해: 분기, 깊이, 과적합

의사결정나무가 한 번에 한 질문씩 학습하는 원리 — 지니와 엔트로피, 깊은 나무가 과적합하는 이유, 그리고 가지치기와 숲으로 고치는 법.

SKSkari Team·2026년 7월·8분
자세히 보기

의사결정나무

각 분기는 하나의 예/아니오 질문으로 데이터를 나누고, 잎에 예측이 남을 때까지 반복합니다.

yesno

Model Lab

그래디언트 부스팅 & XGBoost: 약한 나무를 강하게

부스팅이 나무를 순차적으로 지어 각각 이전을 바로잡는 원리 — XGBoost와 LightGBM이 정형 데이터를 지배하는 이유, 그리고 중요한 설정.

SKSkari Team·2026년 7월·9분
자세히 보기

그래디언트 부스팅

새 나무마다 이전 오차를 바로잡아 — 잔차가 라운드마다 줄어듭니다.

잔차 오차 →

Model Lab

교차검증: 믿을 수 있는 모델 점수 매기기

단일 학습/테스트 분할이 거짓말할 수 있는 이유, k-겹 교차검증이 안정적 추정을 주는 방법, 그리고 모든 점수를 조용히 부풀리는 누수.

SKSkari Team·2026년 7월·8분
자세히 보기

K-겹 교차검증

데이터를 k개 겹으로 나눠, 각 겹이 차례로 검증 세트가 되고 나머지가 학습합니다.

■ 검증□ 학습

Model Lab

하이퍼파라미터 튜닝: 그리드, 랜덤, 검증 곡선

파라미터와 하이퍼파라미터의 차이, 그리드·랜덤 탐색이 최적점을 찾는 법, 그리고 검증 곡선이 튜닝 자체의 과적합을 막는 이유.

SKSkari Team·2026년 7월·8분
자세히 보기

하이퍼파라미터 튜닝

학습 오차는 계속 내려가지만 검증 오차는 바닥을 치고 오릅니다 — 과적합 직전의 최적점.

최적학습검증

Model Lab

PCA와 차원 축소: 더 적은 열, 같은 신호

주성분분석이 상관된 많은 열을 몇 개로 압축하는 방법, 성분의 의미, 스케일링이 중요한 이유, 그리고 언제 쓸지.

SKSkari Team·2026년 7월·8분
자세히 보기

주성분분석

PCA는 분산이 가장 큰 축을 찾습니다 — 긴 화살표(PC1)가 퍼짐의 대부분을 담습니다.

PC1PC2