한 평균을 기준값과 비교하거나, 두 집단의 평균이 서로 다른지 확인합니다.
평균이 5점 높으면 새 수업이 더 좋다고 말해도 될까?
기존 수업을 받은 학생 20명의 평균 점수는 75점이고, 새로운 수업을 받은 학생 20명의 평균 점수는 80점이라고 해봅시다. 표본에서 확인된 평균 차이는 5점입니다.
표본에서 확인된 평균 차이: 5점
평균만 보면 새로운 수업이 더 좋아 보입니다. 하지만 다른 학생 20명씩을 뽑았다면 평균 차이가 2점이나 8점으로 나왔을 수도 있습니다. 지금 관측한 5점이 수업 방식의 차이 때문인지, 이번 표본에 포함된 학생들이 달랐기 때문인지는 아직 알 수 없습니다.
핵심 질문
표본에서 관측된 평균 차이를 모집단의 평균 차이로 볼 만한 근거가 충분할까요?
한 평균과 기준 또는 두 집단 평균 사이의 차이를 계산합니다.
표본 크기와 집단 내 산포가 차이의 불확실성을 결정합니다.
관측한 평균 차이가 표준오차 몇 배인지 비교합니다.
평균을 비교하는 분석부터 차근차근
t검정은 평균을 비교하는 가설검정입니다
t검정은 한 집단의 평균을 정해진 기준값과 비교하거나, 두 집단의 평균을 서로 비교할 때 사용합니다. 단순히 표본평균이 다른지를 확인하는 것이 아니라, 표본에서 관측한 차이를 바탕으로 모집단 평균도 다르다고 볼 수 있는지를 판단합니다.
| 비교 상황 | 확인하려는 질문 | 사용할 검정 |
|---|---|---|
| 한 집단과 기준값 | 제품의 평균 무게가 500g과 다른가? | 단일표본 t검정 |
| 서로 다른 두 집단 | 새 수업과 기존 수업의 평균 점수가 다른가? | 독립표본 t검정 |
| 같은 대상의 두 시점 | 약을 먹은 뒤 평균 혈압이 낮아졌는가? | 대응표본 t검정 |
t검정이 비교하는 대상
표본평균 자체가 아니라, 표본에서 얻은 정보를 이용해 모집단 평균 또는 모집단 평균 차이에 관한 가설을 검정합니다.
표본평균은 표본을 다시 뽑을 때마다 달라집니다
두 표본평균은 거의 항상 조금씩 다릅니다. 두 모집단의 평균이 실제로 같더라도, 표본에 포함된 사람이 다르면 표본평균과 평균 차이가 달라질 수 있습니다.
같은 모집단에서 학생을 다시 뽑으면
표본 1
새 수업 80점
기존 수업 75점
차이 5점
표본 2
새 수업 78점
기존 수업 76점
차이 2점
표본 3
새 수업 82점
기존 수업 74점
차이 8점
모집단 평균이 같아도 표본을 누구로 구성했는지에 따라 두 표본평균은 달라질 수 있습니다.
따라서 평균 차이 5점이라는 숫자만으로는 부족합니다. 이 차이가 표본을 다시 뽑았을 때도 비슷하게 나타날 정도로 안정적인지 함께 확인해야 합니다.
관측한 평균 차이를 그 차이의 표준오차와 비교합니다
두 집단의 평균 차이가 클수록 모집단 평균도 다를 가능성이 커집니다. 그러나 집단 안의 값들이 크게 퍼져 있거나 표본이 작으면, 같은 평균 차이도 표본에 따라 쉽게 달라질 수 있습니다.
차이는 같고, 불확실성은 작음
평균 차이 5점 · 표준오차 1점 · t = 5.0
차이는 같고, 불확실성은 큼
평균 차이 5점 · 표준오차 5점 · t = 1.0
두 집단 평균을 비교할 때
표준오차는 같은 모집단에서 표본을 반복해서 뽑았을 때 두 표본평균의 차이가 얼마나 달라질 수 있는지를 추정한 값입니다. 따라서 t값은 관측된 평균 차이가 그 차이의 불확실성에 비해 얼마나 큰지를 나타냅니다.
숫자로 읽기
평균 차이가 5점이고 평균 차이의 표준오차가 2점이면 t값은 2.5입니다. 현재 관측한 5점의 차이가 표본추출로 생기는 평균 차이의 변동보다 2.5배 크다는 뜻입니다.
평균 차이만으로 결론을 내릴 수 없는 이유
검정 종류는 데이터 모양이 아니라 수집 방식이 결정합니다
| 질문 | 판단 기준 | 선택 |
|---|---|---|
| 기준값 하나와 비교하는가? | 예: 평균 무게와 500g 비교 | 단일표본 |
| 같은 대상을 두 번 측정했는가? | 예: 환자의 치료 전후 혈압 | 대응표본 |
| 서로 다른 두 집단인가? | 예: A반과 B반의 점수 | 독립표본 |
대응표본을 구분하는 가장 쉬운 기준
한 행에 있는 두 값을 빼는 것이 실제 의미를 가지면 대응표본입니다. 같은 환자의 전후 혈압은 뺄 수 있지만, 서로 무관한 두 사람의 값을 행 번호만 맞춰 빼면 안 됩니다.
서로 다른 두 집단을 비교할 때는 두 집단의 분산이 같다고 가정하지 않는 Welch t검정을 기본값으로 사용하는 것이 안전합니다.
질문 확인부터 효과크기 해석까지
| 단계 | 하는 일 |
|---|---|
| 1 | 무엇의 평균을 비교하는지 정합니다. |
| 2 | 단일표본·독립표본·대응표본 중 알맞은 검정을 선택합니다. |
| 3 | 표본평균 또는 두 표본의 평균 차이를 계산합니다. |
| 4 | 표준편차와 표본 크기로 평균 차이의 표준오차를 계산합니다. |
| 5 | 평균 차이를 표준오차로 나누어 t값을 구합니다. |
| 6 | t분포를 이용해 p값과 신뢰구간을 계산합니다. |
| 7 | 평균 차이와 효과크기를 함께 해석합니다. |
계산 자체는 프로그램이 수행합니다. 사람이 반드시 확인해야 하는 부분은 비교 대상과 데이터 수집 방식, 그리고 출력된 수치를 어떤 순서로 해석할지입니다.
차이의 크기, 가능한 범위, 통계적 근거를 함께 봅니다
평균 차이
6.25 mmHg
95% 신뢰구간
5.16–7.34
t값
12.64
자유도
11
p값
< .001
결과는 p값 하나가 아니라 차이의 크기, 가능한 범위, 통계적 근거를 함께 읽습니다.
| 결과 | 읽는 질문 |
|---|---|
| 평균 차이 | 어느 집단이 얼마나 높은가 또는 낮은가? |
| 95% 신뢰구간 | 모집단의 평균 차이는 어느 범위에 있을 수 있는가? |
| t값과 자유도 | 평균 차이가 표준오차에 비해 얼마나 큰가? |
| p값 | 모집단 평균이 같다는 가정에서 현재 결과가 얼마나 드문가? |
| 효과크기 | 단위와 표본 크기를 제외했을 때 차이가 얼마나 큰가? |
해석 순서
먼저 평균 차이의 방향과 크기를 읽고, 신뢰구간으로 추정의 범위를 확인한 뒤, p값으로 통계적 근거를 판단합니다. 마지막으로 효과크기와 연구 맥락을 이용해 실제 중요성을 평가합니다.
t값이 만들어지고 결과로 이어지는 과정
같은 사람 12명의 혈압을 처음부터 끝까지 분석합니다
투약 전 → 투약 후 혈압
142→136 · 128→124 · 155→148 · 137→132 · 149→141 · 131→127
160→151 · 145→138 · 133→129 · 152→144 · 139→133 · 147→140
같은 사람을 투약 전후로 측정했으므로 대응표본 t검정을 사용합니다. 각 사람의 감소량은 6, 4, 7, 5, 8, 4, 9, 7, 4, 8, 6, 7mmHg이며, 평균 감소량은 6.25mmHg입니다.
| 결과 | 값 |
|---|---|
| 평균 감소량 | 6.25mmHg |
| 감소량의 표준오차 | 0.494 |
| t값 | 12.64 |
| 자유도 | 11 |
| p값 | < .001 |
| 95% 신뢰구간 | [5.16, 7.34] |
결과 해석
투약 후 평균 혈압은 투약 전보다 6.25mmHg 낮았습니다. 평균 감소량의 95% 신뢰구간은 5.16~7.34mmHg였으며, 감소는 통계적으로 유의했습니다 (t(11)=12.64, p<.001). 이 표본에서는 투약 후 혈압이 일관되게 감소했다는 강한 근거가 확인되었습니다.
결과를 크게 왜곡하는 항목부터 확인합니다
| 우선순위 | 확인할 것 | 문제가 생기면 |
|---|---|---|
| 1 | 관측값의 독립성 | 반복측정·군집 구조를 무시하면 표준오차가 잘못됩니다. |
| 2 | 대응·독립 여부 | 잘못 선택하면 정보를 버리거나 무의미한 짝을 만듭니다. |
| 3 | 극단적 이상치 | 평균과 표준편차가 동시에 크게 달라질 수 있습니다. |
| 4 | 작은 표본의 심한 비대칭 | t검정 결과가 불안정해질 수 있습니다. |
| 5 | 독립표본의 분산 차이 | 합동분산 대신 Welch 검정을 사용합니다. |
정규성 검정 통과 여부만 기계적으로 보는 것보다, 원자료의 분포와 이상치를 그래프로 확인하고 연구 설계에 맞는 검정을 선택하는 것이 더 중요합니다.
t검정 결과를 잘못 읽는 대표적인 경우
오해 1 · p값이 작으면 효과가 크다
p값은 효과크기가 아닙니다. 같은 효과도 표본이 커지면 p값이 더 작아질 수 있습니다.
오해 2 · p값이 크면 두 집단은 같다
차이가 없다는 증명이 아니라, 현재 자료만으로 차이를 입증할 근거가 부족하다는 뜻입니다.
오해 3 · 두 열의 길이가 같으면 대응표본이다
행 번호가 아니라 같은 대상에서 나온 두 값인지 확인해야 합니다.
오해 4 · 정규성 검정을 통과해야만 사용할 수 있다
표본 크기, 이상치, 비대칭 정도를 함께 판단해야 하며 검정 하나로 결정하지 않습니다.
혈압 자료를 처음부터 끝까지 분석하기
평균 차이·산포·표본 크기가 결과를 어떻게 바꾸는지 관찰합니다
평균 차이를 크게 만들고, 집단 안의 산포를 넓히거나 좁히고, 표본 크기를 바꿔보세요. 세 요소가 t값, p값, 신뢰구간에 어떤 영향을 주는지 확인합니다.
같은 평균 차이를 세 조건과 두 설계에서 보기
두 학급의 학생들입니다. 대응표본 줄은 같은 사람을 두 번 측정했고 두 점수의 상관이 0.8이라고 가정한 경우입니다.
| 설계 | 표준오차 | t | 자유도 | p | 95% 신뢰구간 |
|---|---|---|---|---|---|
| 독립표본 | 2.85 | 1.76 | 38 | 0.0870 | [-0.76, 10.76] |
| 대응표본 | 1.27 | 3.93 | 19 | 0.0009 | [2.34, 7.66] |
평균 차이 5.0점을 표준오차 2.85과 견주면, 서로 다른 두 학급일 때 t = 1.76, p = 0.0870입니다.
평균 차이는 그대로입니다. 나머지를 정하는 것은 퍼짐과 표본 크기, 그리고 설계입니다.
t검정 인터랙티브 랩
효과와 불확실성을 바꾸며 두 분포의 겹침, 검정통계량과 판단 경계가 함께 움직이는지 보세요.
조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.
현재 조건
1.0 · 1.1
조절값과 그래프의 변화를 함께 확인하세요.
한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.
관찰할 것
평균·산포·표본 크기를 바꿔보기
t검정을 사용할 때 기억해야 할 판단 규칙
공식과 예외는 핵심 흐름을 이해한 뒤 확인합니다
| 주제 | 핵심 내용 |
|---|---|
| 왜 t분포를 쓰는가 | 모집단 표준편차를 모르고 표본 표준편차로 대신하기 때문입니다. |
| 자유도 | 표준편차를 추정할 때 사용 가능한 독립 정보의 수를 반영합니다. |
| Welch 자유도 | 두 집단의 분산과 표본 크기가 다를 때 근사 자유도를 사용합니다. |
| 대응표본의 장점 | 개인차를 제거해 평균 변화량의 표준오차를 줄일 수 있습니다. |
| 비모수 대안 | 작은 표본에서 극단적 비대칭이나 이상치가 심하면 대안을 검토합니다. |
공식은 마지막에
공식은 분석의 구조를 확인하는 도구입니다. 먼저 무엇을 비교하고 왜 표준오차가 필요한지 이해한 뒤, 검정 종류별 공식의 차이를 보는 편이 좋습니다.