원점수를 정렬된 분포 안의 위치로 바꾸고 가운데와 꼬리를 요약하기
시험에서 82점을 받았다는 사실만으로 잘한 것인지 알 수 있을까요?
쉬운 시험에서 대부분이 90점이면 82점은 낮고, 어려운 시험에서 대부분이 50점이면 매우 높습니다. 값의 의미는 비교분포 안에서 어디에 놓이는지에 달려 있습니다.
백분위수는 정렬한 자료를 100부분의 위치로 나누고 사분위수는 4부분으로 요약합니다. 단위가 다른 결과의 상대위치를 비교하고 이상치에 강건한 분포 요약을 만듭니다.
핵심 질문
이 값보다 작거나 같은 관측값이 전체의 몇 퍼센트이며 가운데 50%는 어디에 놓이는가?
값의 크기를 전체 분포 안에서의 상대적 위치로 바꿉니다.
정렬된 자료를 네 부분으로 나눠 중심과 폭을 요약합니다.
Q3−Q1로 극단값의 영향을 줄인 산포를 나타냅니다.
p번째 백분위수 P_p는 자료의 약 p%가 그 이하가 되는 경계값입니다. 반대로 한 관측값의 백분위 순위는 그 값 이하가 몇 %인지 나타냅니다.
“90백분위수 점수는 92점”과 “92점은 90백분위에 있다”는 방향이 반대인 같은 관계입니다. 상위 10%와 90번째 백분위도 표현방향을 명확히 합니다.
자료 10,20,30,40,50에서 중앙값은 30입니다. 25번째 백분위수 위치를 (n−1)p+1로 정의하면 2번째 관측인 20, 75번째는 40입니다.
소프트웨어마다 p(n+1), (n−1)p+1 등 위치공식과 보간법이 달라 작은 표본의 값이 달라질 수 있습니다. 방법 이름이나 패키지 기본값을 보고합니다.
정렬자료 10,20,30,40에서 p=0.25이면 L=(4−1)×0.25+1=1.75입니다. 첫 값에서 둘째 값으로 75% 이동해 Q1=17.5가 됩니다.
다른 사분위수 정의는 하위 절반의 중앙값을 사용해 15를 낼 수 있습니다. 어느 값이 절대적으로 틀린 것이 아니라 정의가 다르므로 동일한 분석 안에서 일관되게 사용합니다.
다섯 수치 요약은 중심·가운데 폭·양쪽 꼬리의 비대칭을 빠르게 보여주며 박스플롯의 기반이 됩니다.
| 요약 | 의미 |
|---|---|
| 최솟값 | 관측된 가장 작은 값 |
| Q1 | 약 25%가 이하 |
| Q2·중앙값 | 약 50%가 이하 |
| Q3 | 약 75%가 이하 |
| 최댓값 | 관측된 가장 큰 값 |
IQR=Q3−Q1은 가운데 절반의 폭입니다. 극단값의 크기에 거의 영향받지 않아 중앙값과 함께 비대칭 자료의 대표 요약으로 사용합니다.
IQR이 같아도 꼬리 길이와 내부 밀도는 다를 수 있습니다. Q1·중앙값·Q3의 실제 값과 히스토그램을 함께 봅니다.
Tukey 박스플롯은 Q1−1.5IQR 아래 또는 Q3+1.5IQR 위 관측을 개별 점으로 표시합니다. 이는 오류 판정이 아니라 더 살펴볼 관측을 표시하는 탐색 규칙입니다.
정규분포가 아니거나 큰 표본·두꺼운 꼬리에서는 정상적인 값도 많이 표시됩니다. 제거 전에 원자료·측정과정을 확인하고 결과 민감도를 비교합니다.
값을 백분위 순위로 바꾸면 1억과 10억의 차이보다 둘의 순서만 중요해져 극단값에 강건하고 단위가 다른 척도를 비교하기 쉽습니다.
대신 값 사이 실제 거리정보를 잃습니다. 50점과 51점, 51점과 90점이 순위상 한 칸 차이일 수 있으므로 임금격차·임상차이처럼 크기가 중요한 질문에는 원단위도 유지합니다.
같은 키 170cm도 연령·성별·국가가 다른 기준집단에서는 백분위가 달라집니다. 성장차트·시험규준·임금분포는 목표 모집단과 기준기간을 명시해야 합니다.
분포가 시간에 따라 변하면 과거 90백분위 경계가 현재 90백분위가 아닙니다. 운영 임계값은 기준분포를 언제 갱신할지 결정합니다.
조사자료는 표본가중치를 누적해 가중 백분위수를 계산합니다. 동일값이 많으면 여러 관측이 같은 백분위 순위를 가지며 midrank·최소·최대 순위 정의가 달라질 수 있습니다.
결측값을 제외한 분모와 결측기전을 보고합니다. 검출한계 아래 값이 많은 자료는 단순 순위가 실제 분포 꼬리를 왜곡할 수 있습니다.
Q1과 Q3를 바꾸며 IQR과 박스플롯 이상치 경계를 확인하세요.
백분위수·사분위수 인터랙티브 랩
중심과 산포를 조절하며 분포의 위치·폭·꼬리와 요약값이 어떻게 달라지는지 확인하세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
계산 결과
IQR 40.0
1.5×IQR 탐색 경계는 -40.0~120.0입니다. 경계 밖 값이 자동 오류라는 뜻은 아닙니다.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
| 주제 | 핵심 내용 |
|---|---|
| Quantile regression | 평균이 아니라 조건부 중앙값·상위분위수를 직접 모형화해 효과가 분포 위치별로 다른지 봅니다. |
| Harrell–Davis estimator | 여러 순서통계량의 가중합으로 분위수를 추정해 특정 분포에서 더 부드러운 추정치를 만듭니다. |
| Percentile normalization | 분포를 공통 순위척도로 바꾸지만 원래 크기와 집단 간 실제 분포차이를 제거할 수 있습니다. |
| 다음 학습 | 왜도와 첨도는 분포의 비대칭과 꼬리·극단값 성향을 수치로 요약합니다. |