배우기
인터랙티브·

도수분포·히스토그램

원자료를 구간별 빈도로 묶어 분포의 중심·산포·모양과 이상을 읽기

1

들어가며

숫자 40개를 눈으로 읽기는 어렵지만 구간별로 세면 분포의 모양이 나타납니다.

원자료 목록에서는 전형적인 값, 여러 집단, 빈 구간과 극단값을 빠르게 찾기 어렵습니다. 도수분포표는 값을 범주·구간별로 세고 히스토그램은 그 빈도를 면적으로 표현합니다.

그림은 자동으로 진실을 보여주지 않습니다. 구간 시작점과 폭에 따라 봉우리와 꼬리가 달라 보이므로 여러 합리적 폭과 원자료 표시를 비교합니다.

핵심 질문

값들은 어느 구간에 모이고, 몇 개의 봉우리·빈틈·꼬리·극단값이 존재하는가?

도수표

구간별 개수

원자료를 구간으로 묶어 개수와 누적비율을 계산합니다.

구간폭

모양의 해상도

너무 넓으면 구조를 숨기고 너무 좁으면 잡음이 늘어납니다.

분포 읽기

봉우리·꼬리

중심·산포·비대칭·빈틈·이상치를 순서대로 확인합니다.

2

도수·상대도수·누적도수

집단 크기가 다르면 도수보다 상대도수를 비교합니다. 누적도수는 순서가 있는 구간에서만 의미가 있으며 명목범주의 임의 순서에는 사용하지 않습니다.

종류계산의미
도수 f구간의 관측 수몇 개인가
상대도수 f/n전체 중 비율몇 %인가
누적도수 Σf이하 구간까지 합몇 개가 경계 이하인가
누적상대도수 Σf/n누적 비율백분위 위치
3

구간 경계를 정확히 정하기

10≤x<20처럼 왼쪽 포함·오른쪽 제외 규칙을 쓰면 경계값이 중복되지 않습니다. 마지막 구간만 오른쪽 끝을 포함하는 식으로 모든 값을 정확히 한 번 세어야 합니다.

측정단위가 정수이면 9.5~19.5 같은 실제경계를 사용할 수 있습니다. 반올림된 값과 연속 측정값을 혼동하면 막대 위치가 어긋납니다.

4

히스토그램과 막대그래프는 다르다

히스토그램은 연속 수치구간이므로 막대가 붙고 순서가 고정됩니다. 막대그래프는 범주형 빈도라 막대 사이가 떨어지며 순서를 바꿀 수 있습니다.

히스토그램의 y축은 도수·비율·밀도일 수 있습니다. 구간폭이 모두 같지 않으면 높이가 아니라 막대 면적이 빈도에 비례하도록 밀도를 사용해야 합니다.

densityheight=f/(n×binwidth)density height=f/(n\times bin width)
밀도 히스토그램 전체 막대 면적의 합은 1입니다.
5

직접 도수표 만들기

자료 2,4,4,5,10,11,14,18을 [0,5),[5,10),[10,15),[15,20)으로 나누면 도수는 3,1,3,1입니다. 5는 두 번째, 10은 세 번째 구간에 들어갑니다.

상대도수는 37.5%,12.5%,37.5%,12.5%이고 누적상대도수는 37.5%,50%,87.5%,100%입니다. 경계 규칙을 표에 명시합니다.

구간도수상대도수누적비율
[0,5)337.5%37.5%
[5,10)112.5%50.0%
[10,15)337.5%87.5%
[15,20)112.5%100%
6

구간폭이 모양을 바꾼다

폭이 너무 넓으면 두 집단과 빈틈·이상치를 하나의 봉우리로 숨깁니다. 너무 좁으면 표본잡음이 수많은 가짜 봉우리처럼 보입니다.

Sturges, Scott, Freedman–Diaconis 규칙은 시작점일 뿐입니다. 특히 FD는 IQR을 사용해 이상치에 비교적 강건하며 표본크기에 따라 폭을 줄입니다.

FDbinwidthh=2IQRn(1/3)FD bin width h=2\cdot IQR\cdot n^(-1/3)
자료범위를 h로 나눠 대략적인 구간 수를 정합니다.
7

분포를 읽는 순서

① 중심이 어디인지 ② 폭과 꼬리가 얼마나 긴지 ③ 대칭인지 ④ 봉우리가 몇 개인지 ⑤ 빈틈·절단·극단값이 있는지 순서대로 봅니다.

봉우리 두 개는 서로 다른 하위집단의 혼합일 수 있고 0에 몰린 값은 구조적 0, 검출한계, 바닥효과일 수 있습니다. 그래프에서 보인 패턴을 자료생성과정으로 확인합니다.

8

표본크기와 빈도 비교

n=20의 히스토그램은 우연한 울퉁불퉁함이 크고 n=20,000은 작은 구조도 드러냅니다. 막대 높이 차이를 실제 분포차이로 해석하기 전에 표본변동을 고려합니다.

두 집단 비교에는 같은 경계·폭·축을 사용하고 도수 대신 비율 또는 밀도를 씁니다. 투명도 중첩, 나란한 패널, ECDF를 함께 활용할 수 있습니다.

9

결측·극단값·축 잘림

결측값은 히스토그램에서 사라지므로 전체 n과 유효 n, 결측 수를 별도로 표시합니다. 매우 큰 극단값 때문에 본체가 눌리면 전체축과 확대패널을 함께 보여줍니다.

축을 임의로 자르거나 극단값을 숨기면 분포가 과도하게 안정적으로 보입니다. 로그축은 넓은 양의 범위를 보기 좋게 하지만 원단위 폭이 같지 않음을 명시합니다.

10

히스토그램의 보완 그래프

한 그래프가 모든 정보를 주지 못합니다. 표본크기와 질문에 따라 개별점·누적분포·요약상자를 조합합니다.

그래프강점주의점
ECDF구간 선택 없음·누적비율국소 봉우리 덜 직관적
밀도곡선부드러운 모양bandwidth·경계 편향
dot/strip plot개별 관측 보존큰 n에서 겹침
boxplot집단 비교 간결다봉성 숨김
violin plot밀도+집단 비교작은 n에서 과도한 부드러움
11

직접 해보기

표본크기와 IQR을 바꾸며 Freedman–Diaconis 권장 구간폭을 확인하세요.

도수분포·히스토그램 인터랙티브 랩

중심과 산포를 조절하며 분포의 위치·폭·꼬리와 요약값이 어떻게 달라지는지 확인하세요.

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

계산 결과

권장 구간폭 10.26

FD 규칙의 출발값입니다. n이 8배가 되면 폭은 절반이 되며 실제 그래프에서는 해석 가능한 인접 폭도 비교합니다.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

12

핵심 정리

  • 도수·상대도수·누적도수는 구간별 개수·비율·누적위치를 서로 다르게 보여줍니다.
  • 히스토그램은 수치구간의 면적으로 빈도를 표현하며 막대그래프와 자료형·간격 의미가 다릅니다.
  • 구간폭과 시작점은 봉우리·빈틈·꼬리 인상을 바꾸므로 여러 합리적 설정을 확인합니다.
  • 중심·산포·비대칭·다봉성·빈틈·극단값 순으로 읽고 자료생성과정으로 원인을 확인합니다.
  • 집단 비교는 동일한 구간과 축·밀도를 사용하고 ECDF·개별점·boxplot으로 보완합니다.
13

더 깊이 알아보기

주제핵심 내용
Kernel density estimation각 관측에 커널을 놓아 부드러운 밀도를 만들며 bandwidth가 구간폭과 같은 평활 상충을 결정합니다.
Adaptive histogram자료가 많은 곳은 좁고 적은 곳은 넓은 구간을 사용하지만 막대 비교 해석이 달라집니다.
Hexbin plot두 연속변수 산점도가 겹칠 때 2차원 구간별 빈도로 밀도를 보여줍니다.
다음 학습상관과 공분산은 두 변수가 각자의 평균에서 같은 방향으로 움직이는지 함께 요약합니다.
다음: 상관·공분산