Worked Example · Exploration
Worked Example: Descriptive Statistics
14 sections
01예제로 들어가기
분석을 시작하기 전에 iris 데이터의 전체 모습을 확인합니다
이번 예제에서는 기술통계를 이용해 iris 데이터가 어떤 값들로 구성되어 있고, 각 변수의 전형적인 값과 변동 정도, 분포 형태, 결측값과 잠재적 이상치를 확인합니다.
기술통계는 집단 차이를 검정하거나 결과를 예측하는 분석이 아닙니다. 본격적인 분석 전에 데이터의 상태를 숫자와 그래프로 요약해 무엇을 비교해야 하는지, 어떤 지표를 사용해야 하는지, 먼저 확인할 문제가 있는지 판단하는 단계입니다.
이 예제에서 확인할 질문은 다음과 같습니다.
붓꽃 150송이의 꽃받침과 꽃잎 크기는 대체로 어느 범위에 있으며, 변수마다 얼마나 다르게 퍼져 있을까? 결측값이나 이상치가 있는가? 세 종을 하나로 합쳐 요약했을 때 놓치게 되는 구조는 무엇일까?
이 질문에 답하기 위해 중심을 나타내는 평균·절사평균·중앙값, 산포를 나타내는 표준편차·IQR·CV, 분포 형태를 나타내는 왜도·첨도, 그리고 범주형 변수의 빈도와 엔트로피를 차례로 살펴보겠습니다.
예제 데이터: iris
분석에는 판별분석 예제와 동일한 iris 데이터를 사용했습니다. 총 150송이의 붓꽃과 5개 변수가 포함되어 있습니다.
| 역할 | 변수 | 의미 |
|---|---|---|
| 수치형 변수 | Sepal.Length | 꽃받침 길이 |
| 수치형 변수 | Sepal.Width | 꽃받침 너비 |
| 수치형 변수 | Petal.Length | 꽃잎 길이 |
| 수치형 변수 | Petal.Width | 꽃잎 너비 |
| 범주형 변수 | Species | 붓꽃의 종: setosa, versicolor, virginica |
이 분석에서는 수치형 변수 네 개와 범주형 변수 한 개를 모두 요약했습니다. 수치형 변수는 중심·산포·백분위수·분포 형태·이상치를 계산하고, Species는 범주의 개수와 빈도 분포를 확인했습니다.
데이터 미리보기
| Sepal.Length | Sepal.Width | Petal.Length | Petal.Width | Species |
|---|---|---|---|---|
| 5.1 | 3.5 | 1.4 | 0.2 | setosa |
| 4.9 | 3.0 | 1.4 | 0.2 | setosa |
| 7.0 | 3.2 | 4.7 | 1.4 | versicolor |
| 6.4 | 3.2 | 4.5 | 1.5 | versicolor |
| 6.3 | 3.3 | 6.0 | 2.5 | virginica |
| 5.8 | 2.7 | 5.1 | 1.9 | virginica |
02분석 결과 한눈에 보기
레코드
150
전체 관측값
변수
5
4 수치, 1 범주
결측
0
결측값 없음
데이터 품질
검토 필요
이상치 감지

- 데이터 구성: 150개 관측값과 수치형 변수 4개, 범주형 변수 1개를 분석했습니다.
- 완전성: 다섯 변수 모두 결측값이 없어 전체 관측값을 그대로 요약할 수 있습니다.
- 중심과 산포: 꽃받침 변수는 평균과 중앙값이 가깝고 상대적 변동도 약 14%로 작았습니다.
- 꽃잎의 변동: Petal.Length의 CV는 46.97%, Petal.Width의 CV는 63.56%로 꽃받침 변수보다 훨씬 컸습니다.
- 분포 구조: 꽃잎 변수의 큰 산포는 단순한 측정 잡음보다 세 종의 서로 다른 크기가 한 분포에 섞인 영향이 큽니다.
- 잠재적 이상치: 1.5 × IQR 기준으로 Sepal.Width에서 4개가 탐지됐으며, 나머지 수치형 변수에서는 탐지되지 않았습니다.
- 범주 균형: setosa, versicolor, virginica가 각각 50개로 정확히 균형을 이룹니다.
- 주의할 요약: Species의 최빈값은 setosa 하나가 아니라 세 종 모두이며, 전체 꽃잎 분포를 단순히 대칭적이라고 요약해서는 안 됩니다.
이 데이터는 결측값이 없고 표본도 충분해 기술통계 계산 자체에는 문제가 없습니다. 그러나 전체 평균과 왜도만 보면 세 종이 섞여 만들어진 분포 구조를 놓칠 수 있습니다. 특히 꽃잎 변수의 큰 IQR과 CV는 개별 종 안에서 값이 크게 흔들리기 때문이라기보다, 꽃잎 크기가 작은 setosa와 큰 virginica가 한꺼번에 포함되어 있기 때문에 나타난 결과입니다.
따라서 이 예제의 핵심은 평균이 얼마인가에서 끝나지 않습니다. 전체 요약값을 확인한 뒤 Species별 분포를 다시 나누어 보는 것이 기술통계에서 다음 분석으로 넘어가는 중요한 판단입니다.
03결과 1. 데이터는 빠짐없이 들어 있었을까?
네 수치형 변수와 Species 모두 관측값이 150개이며 결측값은 0개입니다. 변수마다 사용된 표본 수가 같으므로 평균이나 산포를 비교할 때 결측 처리 방식의 차이로 결과가 달라질 위험은 없습니다.
| 확인 항목 | 결과 | 의미 |
|---|---|---|
| 전체 관측값 | 150 | 붓꽃 150송이 |
| 수치형 변수 | 4개 | 꽃받침·꽃잎의 길이와 너비 |
| 범주형 변수 | 1개 | Species |
| 결측값 | 0개 | 모든 변수에서 완전한 값 사용 |
| Species 고유값 | 3개 | setosa, versicolor, virginica |

다만 결측값이 없다는 사실만으로 데이터 품질이 완전하다고 말할 수는 없습니다. 원자료에는 모든 값이 같은 완전 중복 행이 1쌍 있습니다. 서로 다른 붓꽃이 우연히 같은 측정값을 가질 수 있으므로 자동으로 삭제할 문제는 아니지만, 식별자가 있다면 실제 중복 입력인지 확인하는 것이 좋습니다.
04결과 2. 붓꽃의 전형적인 크기는 얼마였을까?
평균은 모든 값을 더해 관측값 수로 나눈 값이고, 중앙값은 값을 정렬했을 때 가운데 위치한 값입니다. 10% 절사평균은 양쪽 끝의 10%씩을 제외한 뒤 계산한 평균으로, 극단값의 영향을 줄인 중심 지표입니다.
| 변수 | 평균 | 10% 절사평균 | 중앙값 |
|---|---|---|---|
| Sepal.Length | 5.84 | 5.81 | 5.80 |
| Sepal.Width | 3.06 | 3.04 | 3.00 |
| Petal.Length | 3.76 | 3.76 | 4.35 |
| Petal.Width | 1.20 | 1.18 | 1.30 |
Sepal.Length와 Sepal.Width는 세 지표가 서로 가깝습니다. 몇 개의 큰 값이나 작은 값이 전체 중심을 크게 끌어당기지 않았으며, 전체 분포의 중심을 평균으로 요약해도 중앙값과 크게 다른 이야기를 하지 않습니다.
반면 Petal.Length는 평균 3.76과 중앙값 4.35의 차이가 0.59입니다. 전체 데이터를 작은 꽃잎을 가진 setosa와 더 큰 꽃잎을 가진 두 종이 함께 구성하고 있기 때문입니다. 평균과 절사평균이 같다고 해서 분포가 단순하거나 정규적이라는 뜻은 아닙니다. 절사해도 세 종의 혼합 구조 자체는 남아 있습니다.
따라서 모든 변수에서 평균과 중앙값이 일치하므로 둘 다 무방하다는 해석은 지나치게 단순합니다. 꽃받침 변수는 평균과 중앙값이 비슷하지만, 꽃잎 변수는 전체 요약보다 종별 분포를 함께 확인해야 합니다.
05결과 3. 어떤 변수가 가장 많이 퍼져 있었을까?
표준편차는 평균 주변에서 값이 얼마나 퍼져 있는지 나타내고, IQR은 가운데 50%의 범위인 Q3 − Q1입니다. CV는 표준편차를 평균으로 나눈 상대적 변동으로, 평균 크기가 다른 양의 수치형 변수의 산포를 비교할 때 사용합니다.
| 변수 | 표준편차 | IQR | 범위 | CV |
|---|---|---|---|---|
| Sepal.Length | 0.83 | 1.30 | 3.60 | 14.17% |
| Sepal.Width | 0.44 | 0.50 | 2.40 | 14.26% |
| Petal.Length | 1.77 | 3.50 | 5.90 | 46.97% |
| Petal.Width | 0.76 | 1.50 | 2.40 | 63.56% |
꽃받침 길이와 너비의 CV는 모두 약 14%로 비슷합니다. 반면 꽃잎 길이와 너비는 상대적 변동이 훨씬 큽니다. 특히 Petal.Width는 평균이 1.20으로 작기 때문에 표준편차 0.76이 평균에 비해 크게 나타나 CV가 63.56%가 됐습니다.
CV가 높다는 이유만으로 해당 변수가 품질이 낮거나 불안정하다고 판단해서는 안 됩니다. iris에서는 꽃잎 크기가 종을 구분하는 핵심 특성이므로 큰 변동 자체가 유용한 집단 차이를 담고 있습니다. 앞선 판별분석에서 Petal.Length와 Petal.Width의 중요도가 높았던 이유와도 연결됩니다.
또한 CV는 평균이 0에 가깝거나 음수가 될 수 있는 변수에는 적절하지 않습니다. 이 예제의 네 변수는 모두 양수이고 같은 측정 계열이므로 상대적 비교가 가능하지만, CV를 모든 수치형 변수의 보편적인 산포 지표로 사용하면 안 됩니다.
06결과 4. 백분위수는 값이 놓인 범위를 어떻게 보여 줄까?
백분위수는 관측값을 작은 순서로 정렬했을 때 특정 비율이 그 값 이하에 놓이는 지점을 뜻합니다. Q1과 Q3는 각각 25번째와 75번째 백분위수이며, 두 값 사이에는 데이터의 가운데 50%가 들어 있습니다.
| 변수 | P5 | Q1 | 중앙값 | Q3 | P95 |
|---|---|---|---|---|---|
| Sepal.Length | 4.60 | 5.10 | 5.80 | 6.40 | 7.25 |
| Sepal.Width | 2.35 | 2.80 | 3.00 | 3.30 | 3.80 |
| Petal.Length | 1.30 | 1.60 | 4.35 | 5.10 | 6.10 |
| Petal.Width | 0.20 | 0.30 | 1.30 | 1.80 | 2.30 |
Petal.Length의 Q1은 1.60인데 중앙값은 4.35입니다. 가운데 50% 범위가 1.60부터 5.10까지 넓게 펼쳐져 있어, 하나의 균일한 집단보다 서로 다른 크기의 집단이 섞였을 가능성을 보여줍니다. 실제로 setosa의 꽃잎 길이는 매우 짧고 versicolor와 virginica는 더 길기 때문에 이런 간격이 생깁니다.
백분위수는 평균과 표준편차만으로 보이지 않는 분포의 위치와 비대칭, 집단 간 간격을 보여 줍니다. 특히 정규분포를 가정하기 어렵거나 극단값이 있을 때 중앙값과 IQR을 함께 보고하는 이유가 여기에 있습니다.
07결과 5. 왜도가 작으면 대칭적이고 정규분포일까?
왜도는 분포가 어느 방향으로 길게 늘어지는지를 나타냅니다. 0에 가까우면 좌우 꼬리의 방향성이 크지 않다는 뜻입니다. 첨도는 정규분포와 비교해 분포의 꼬리와 봉우리 형태가 얼마나 다른지 보여주는 지표입니다.
| 변수 | 왜도 | 초과첨도 | 1차 해석 |
|---|---|---|---|
| Sepal.Length | 0.31 | −0.57 | 약한 오른쪽 치우침, 비교적 평평함 |
| Sepal.Width | 0.32 | 0.18 | 약한 오른쪽 치우침, 정규분포와 비슷한 첨도 |
| Petal.Length | −0.27 | −1.40 | 약한 왼쪽 치우침, 매우 평평한 혼합분포 |
| Petal.Width | −0.10 | −1.34 | 왜도는 작지만 매우 평평한 혼합분포 |
왜도가 모두 −0.27에서 0.32 사이이므로 한쪽으로 길게 늘어진 정도는 크지 않습니다. 그러나 왜도가 0에 가깝다고 해서 정규분포라는 뜻은 아닙니다. 서로 떨어진 두세 집단이 섞인 분포도 전체 좌우 균형이 맞으면 왜도가 작게 나올 수 있습니다.
꽃잎 변수의 초과첨도가 약 −1.4로 매우 낮은 것은 하나의 뾰족한 봉우리보다 값이 넓게 퍼지고 여러 구간에 모여 있다는 신호입니다. 따라서 대체로 대칭적이라는 한 문장만으로 분포 형태를 요약하기보다 히스토그램을 통해 봉우리의 개수와 종별 군집을 확인해야 합니다.
현재 화면 보완점:
제공된 분포 그래프는 Sepal.Length 한 변수만 보여 줍니다. 기술통계 페이지에서는 네 수치형 변수의 히스토그램을 모두 확인할 수 있어야 Petal.Length와 Petal.Width의 혼합분포를 놓치지 않습니다.
08결과 6. Sepal.Length 그래프에서는 무엇을 읽을 수 있을까?
Sepal.Length의 평균은 5.84, 중앙값은 5.80으로 거의 같습니다. 왜도도 0.31로 작고 IQR 기준 이상치는 탐지되지 않았습니다. 전체적인 위치와 꼬리 방향만 보면 평균이 중심을 크게 왜곡하지 않는 변수입니다.

하지만 히스토그램의 형태가 완벽한 종 모양이라고 단정할 수는 없습니다. 세 종의 꽃받침 길이 평균은 setosa 5.01, versicolor 5.94, virginica 6.59로 다릅니다. 종별 분포가 일부 겹치면서 전체 히스토그램이 넓고 완만한 모양을 만들기 때문입니다.
그래프의 빨간 점선과 초록 점선이 가까운 것은 평균과 중앙값의 위치가 비슷하다는 뜻입니다. 이것은 중심 지표가 안정적이라는 근거는 되지만 정규성 검정을 대신하지는 않습니다. 이후 분석이 정규성 가정에 의존한다면 Q–Q plot과 정규성 검정을 별도로 확인해야 합니다.
09결과 7. 이상치 네 개는 제거해야 할까?
1.5 × IQR 기준에서 Sepal.Width의 하한은 2.05, 상한은 4.05입니다. 이 범위를 벗어난 값은 2.0, 4.1, 4.2, 4.4의 네 개이며 전체의 2.67%입니다.
| 값 | Species | IQR 기준에서의 위치 |
|---|---|---|
| 4.4 | setosa | 상한 4.05 초과 |
| 4.1 | setosa | 상한 4.05 초과 |
| 4.2 | setosa | 상한 4.05 초과 |
| 2.0 | versicolor | 하한 2.05 미만 |
이 네 값은 잠재적 이상치이지 자동으로 제거해야 하는 오류가 아닙니다. setosa는 다른 종보다 꽃받침 너비가 넓은 경향이 있으므로, 세 개의 큰 값은 setosa 집단에서는 충분히 가능한 관측값일 수 있습니다. 전체 데이터를 하나로 합친 IQR 경계가 종별 차이를 이상치처럼 표시한 것입니다.
따라서 원자료 입력 오류인지 확인한 뒤, 오류가 아니라면 그대로 유지하는 것이 적절합니다. 분석 목적이 종 간 차이를 비교하는 것이라면 전체 IQR뿐 아니라 Species별 상자그림과 집단별 IQR 기준을 함께 확인해야 합니다.
10결과 8. Species는 균형 있게 구성됐을까?
Species에는 setosa, versicolor, virginica의 세 범주가 있으며 각각 50개씩 포함되어 있습니다.
| Species | 빈도 | 비율 |
|---|---|---|
| setosa | 50 | 33.33% |
| versicolor | 50 | 33.33% |
| virginica | 50 | 33.33% |

세 범주의 빈도가 모두 같으므로 하나의 고유한 최빈값은 없습니다. 화면에 setosa가 최빈값으로 표시된 것은 동률인 값 가운데 첫 번째 범주를 반환했기 때문이며, 정확한 설명은 세 종이 모두 공동 최빈값이라는 것입니다.
엔트로피는 1.58비트이며, 세 범주가 동일한 비율일 때 가능한 최대값인 log₂(3) ≈ 1.585와 같습니다. 특정 종에 관측값이 몰리지 않고 범주가 완전히 균형을 이룬다는 뜻입니다. 이 균형은 이후 종별 비교나 분류모형에서 다수 클래스가 결과를 지배하는 문제를 줄여 줍니다.
11전체 요약이 가리는 Species별 차이
전체 기술통계만으로는 꽃잎 변수의 큰 산포가 어디서 왔는지 알기 어렵습니다. Species별 평균을 나누어 보면 구조가 명확해집니다.
| Species | Sepal.Length | Sepal.Width | Petal.Length | Petal.Width |
|---|---|---|---|---|
| setosa | 5.01 | 3.43 | 1.46 | 0.25 |
| versicolor | 5.94 | 2.77 | 4.26 | 1.33 |
| virginica | 6.59 | 2.97 | 5.55 | 2.03 |
Petal.Length와 Petal.Width는 세 종의 평균이 단계적으로 크게 달라집니다. 전체 표준편차와 IQR이 컸던 주된 이유가 이 종별 차이입니다. 기술통계는 데이터를 요약하는 출발점이지만, 전체 요약값 하나가 서로 다른 하위집단을 대표한다고 가정해서는 안 됩니다.
이 결과는 다음 분석의 방향도 알려 줍니다. 종별 평균 차이를 검정하려면 ANOVA 또는 비모수 검정을, 여러 측정값으로 종을 구분하려면 앞선 예제의 선형판별분석을 사용할 수 있습니다.
12이 예제의 결론
iris 데이터는 150개 관측값과 다섯 변수에 결측값이 없어 분석 가능한 상태였습니다. 꽃받침 변수는 평균과 중앙값이 가깝고 CV도 약 14%로 비교적 안정적이었지만, 꽃잎 변수는 세 종의 크기 차이가 한꺼번에 반영되어 IQR과 CV가 크게 나타났습니다.
Sepal.Width에서는 전체 IQR 기준 잠재적 이상치 네 개가 탐지됐지만, 세 개는 꽃받침 너비가 원래 큰 setosa에 속했습니다. 따라서 이상치 표시만 보고 제거하면 실제 종 특성을 잃을 수 있습니다. Species는 세 종이 각각 50개로 완전히 균형적이며, 하나의 최빈 범주가 존재하지 않습니다.
한 문장으로 정리하면
iris 데이터는 완전하고 균형적이지만, 전체 기술통계만 보면 세 종이 섞여 만든 꽃잎 분포와 종별 차이를 놓칠 수 있으므로 전체 요약과 그룹별 분포를 함께 보아야 합니다.
13다음으로 확인하면 좋은 것
- Species별 기술통계 — 네 수치형 변수의 평균·중앙값·표준편차·IQR을 종별로 다시 계산합니다.
- 그룹별 분포 시각화 — 바이올린 플롯이나 상자그림으로 세 종의 겹침과 분리를 확인합니다.
- 이상치 원자료 확인 — Sepal.Width 네 관측값이 입력 오류인지 실제 측정값인지 점검합니다.
- 정규성 확인 — 평균 기반 검정이 필요하다면 Species별 Q–Q plot과 정규성 검정을 확인합니다.
- 집단 차이 검정 — 세 종의 평균 차이를 확인하려면 일원분산분석과 사후검정을 적용합니다.
- 다변량 구조 확인 — 여러 측정값을 함께 사용해 종을 구분하려면 판별분석이나 분류모형으로 이어갑니다.
14출처
- 데이터: iris_statistica.csv
- 분석 범위: 수치형 변수 4개와 범주형 변수 1개, 관측값 150개