두 변수의 관계와 집단별 분포를 그림으로 진단하기
상관계수가 같아도 점들의 모양은 직선·곡선·군집·이상치로 완전히 다를 수 있습니다.
산점도는 두 수치변수의 개별 관측을 좌표로 표시하고, 상자그림은 한 수치변수의 중앙값과 사분위 범위를 압축해 집단 간 분포를 비교합니다.
수치 요약이 숨긴 구조를 확인하는 가장 기본적인 진단 도구입니다.
핵심 질문
관계의 모양과 집단별 분포는 어떠하며, 요약값을 왜곡하는 관측이 있는가?
점의 방향·형태·군집·이상점을 보존해 관계를 보여줍니다.
중앙값·IQR·수염으로 여러 집단의 분포를 간결히 비교합니다.
개별점과 요약상자를 함께 보면 작은 표본과 다봉성을 놓치지 않습니다.
각 점은 한 관측대상의 (X,Y) 쌍입니다. 가로축은 설명·입력 변수, 세로축은 결과 변수를 두는 경우가 많지만 축 배치만으로 인과가 생기지는 않습니다.
점 하나가 고객인지 거래인지 월평균인지 확인해야 합니다. 고객별 월평균과 거래별 원자료는 같은 변수라도 점의 수·가중치·관계가 달라집니다.
축의 단위·범위·선형 또는 로그척도와 결측으로 빠진 관측 수를 먼저 확인합니다. 로그축에서 같은 시각적 간격은 같은 차이가 아니라 같은 배율을 뜻합니다.
상관계수 하나보다 방향·형태·강도·특이점을 차례로 읽는 편이 안전합니다.
| 요소 | 확인할 내용 |
|---|---|
| 방향 | 오른쪽 위·오른쪽 아래·무방향 |
| 형태 | 직선·곡선·문턱·군집 |
| 강도 | 추세선 주변의 흩어짐 |
| 특이점 | 이상치·고레버리지·빈 구간 |
직선 추세선은 X가 1단위 변할 때 Y의 평균이 얼마나 달라지는지 요약하지만 곡선·문턱·집단 구조를 가릴 수 있습니다. 직선과 LOESS 같은 평활선을 함께 보면 선형성 가정이 타당한지 탐색할 수 있습니다.
평활선의 굴곡은 모양 탐색용이며 표본 끝에서는 관측이 적어 불안정합니다. 눈에 보이는 굴곡을 곧바로 인과효과나 표본 밖 예측으로 해석하지 않습니다.
추세선 주변의 신뢰띠는 같은 X에서 평균 Y의 불확실성입니다. 새 개인의 값이 들어올 예측구간은 잔차 변동까지 포함하므로 훨씬 넓습니다.
표본이 크거나 값이 반올림되면 여러 관측이 한 점처럼 겹칩니다. 투명도, 점 크기 축소, jitter, 육각형 bin 또는 밀도등고선을 사용합니다.
겹침을 무시하면 밀집영역과 표본 수를 잘못 판단합니다.
상자의 아래·위는 Q1·Q3, 내부 선은 중앙값, 상자 높이는 IQR입니다. 수염은 흔히 1.5×IQR 경계 안의 마지막 실제 관측까지 이어집니다. 경계값 자체까지 선을 그리는 것은 아닙니다.
수염이 최솟값·최댓값, 특정 백분위수, 1.5×IQR 중 무엇을 뜻하는지는 소프트웨어마다 다를 수 있습니다. 노치가 있으면 보통 중앙값의 근사 신뢰구간이지만 표본이 작을 때는 부정확할 수 있습니다.
1.5IQR 밖의 점은 추가 확인 후보이지 자동 삭제할 오류가 아닙니다. 실제 희귀사례, 측정오류, 다른 집단 또는 자연스러운 긴 꼬리일 수 있습니다.
원자료를 확인하고 분석 목적에 근거해 유지·수정·제외 여부를 결정합니다.
상자의 위치로 중앙값, 높이로 IQR, 수염과 점으로 꼬리·극단값을 비교합니다. 중앙값 차이가 커 보여도 각 집단의 표본 수와 내부 산포가 크면 불확실성이 큽니다.
상자그림은 표본 수와 다봉성을 숨깁니다. n=10과 n=1,000의 상자가 비슷하게 보일 수 있으므로 n을 표시하고, 작은 표본은 개별 점을 겹쳐 그립니다.
분포 모양이 중요하면 violin이나 raincloud를 보완하되, 밀도 폭은 관측 수가 아니라 추정 밀도일 수 있으므로 범례를 확인합니다. 비교 집단은 동일한 축과 동일한 폭 규칙을 사용합니다.
그래프는 데이터 유형이 아니라 답하려는 질문에 맞춰 선택합니다.
| 질문 | 권장 그래프 |
|---|---|
| 두 수치변수의 관계 | 산점도 |
| 한 수치변수의 분포 | 히스토그램·밀도 |
| 범주별 수치분포 비교 | 상자그림·violin |
| 개별값과 분포 모두 | jitter+상자·raincloud |
축 범위를 집단마다 다르게 두거나, 투명도 없이 점을 겹치거나, 상자 밖 점을 무조건 삭제하거나, 작은 표본의 상자그림만 보고 분포를 단정하는 실수가 흔합니다.
색상과 모양을 너무 많이 사용하면 핵심 비교가 흐려집니다.
Q3=60인 자료에서 IQR과 후보값을 바꾸며 1.5×IQR 판정이 맥락 없이 삭제 규칙이 될 수 없는 이유를 확인하세요.
산점도·박스플롯 인터랙티브 랩
관계·잡음·영향점을 바꾸며 회귀선, 잔차와 설명력이 동시에 어떻게 변하는지 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
계산 결과
경계보다 10.0 높음
상한은 90.0입니다. 표시 여부는 IQR에 따라 바뀌지만 오류 여부는 원자료·수집과정·도메인 지식으로 판단합니다.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
| 주제 | 핵심 내용 |
|---|---|
| Anscombe의 사중주 | 요약통계가 거의 같아도 산점도 구조가 전혀 다를 수 있음을 보여주는 고전 예제입니다. |
| 고레버리지와 영향점 | X축에서 멀리 떨어진 점이 회귀선과 상관계수를 얼마나 바꾸는지 진단합니다. |
| 분포형 그래프 | violin·beeswarm·raincloud plot은 상자그림이 숨기는 다봉성과 개별값을 보완합니다. |
| 다음 학습 | 그래프 목적과 시각 부호를 연결하고 왜곡 없이 읽고 설계하는 원칙을 배웁니다. |