배우기
인터랙티브·

단순선형회귀

하나의 설명변수와 연속형 결과 사이의 평균 관계를 직선으로 요약합니다.

1

들어가며

공부를 한 시간 더 하면 점수는 얼마나 달라질까?

같은 시험을 본 학생이라도 학습시간과 점수는 제각각입니다. 학습시간이 긴 학생의 점수가 대체로 높아 보여도, 그 관계가 얼마나 큰지와 학생별 차이가 얼마나 남는지는 눈대중만으로 알기 어렵습니다.

단순선형회귀는 설명변수 하나와 연속형 결과의 평균 관계를 직선으로 요약합니다. 모든 점을 정확히 맞추는 선이 아니라, X가 달라질 때 Y의 평균이 어떻게 달라지는지를 가장 간결하게 나타내는 선을 찾습니다.

핵심 질문

설명변수 X가 1단위 달라질 때 결과 Y의 평균은 어느 방향으로 얼마나 달라질까요?

산점도

관측자료

두 수치형 변수의 방향·형태·이상점을 먼저 확인합니다.

회귀선

기울기

X가 1단위 증가할 때 Y의 조건부 평균 변화를 나타냅니다.

잔차

실제−예측

각 점에서 회귀선까지의 수직 차이로 모형 오차를 봅니다.

2

무엇을 알아보는 분석인가

하나의 X로 Y의 조건부 평균을 설명합니다

단순회귀 모형은 Yᵢ=β₀+β₁Xᵢ+εᵢ이며, 표본에서 얻은 적합식은 ŷ=b₀+b₁X입니다. β₀와 β₁은 모집단의 관계, b₀와 b₁은 표본에서 추정한 값입니다.

회귀선 위의 ŷ는 특정 X를 가진 관측치 하나의 확정값이 아니라 그 X에서 기대되는 평균 Y입니다. 실제 관측값은 개인차와 측정오차 때문에 선 위아래로 흩어집니다.

구성학습시간 사례묻는 질문
결과 Y시험점수(점)무엇을 설명할까?
설명변수 X주당 학습시간(시간)무엇에 따라 평균이 달라질까?
적합값 ŷ예측 평균점수해당 X에서 기대되는 평균은?
잔차 e실제점수−예측점수직선이 설명하지 못한 차이는?
3

기울기는 어떻게 읽는가

X 1단위당 Y 평균의 변화량입니다

b₁은 X가 1단위 증가할 때 예측되는 Y 평균의 변화량입니다. 양수이면 증가, 음수이면 감소 관계이며, 크기는 반드시 X와 Y의 단위를 붙여 읽습니다.

학습시간 계수가 4.2점/시간이면 학습시간이 1시간 더 긴 학생은 평균 점수가 4.2점 높다고 예측됩니다. X가 5시간 늘면 선형모형 안에서는 평균 차이를 5×4.2=21점으로 계산합니다.

기울기방향해석 예시
4.2양의 관계1시간당 평균 4.2점 증가
0선형 변화 없음X가 달라도 평균 Y가 일정
−1.5음의 관계1단위당 평균 1.5 감소

연관과 인과를 구분합니다

기울기는 관찰된 평균 관계입니다. 무작위배정이나 충분한 인과 설계가 없다면 “한 시간 더 공부시키면 4.2점 오른다”는 인과효과로 바로 바꿔 말할 수 없습니다.

4

절편은 언제 의미가 있는가

X=0에서의 예측 평균이지만 자료 범위를 먼저 봅니다

b₀는 X=0일 때의 예측 Y입니다. 0이 실제로 가능한 값이고 자료 범위에 포함되면 유용한 기준점이지만, 관측된 X가 30~60인데 X=0을 해석하면 먼 외삽이 됩니다.

절편이 해석하기 어렵다면 X에서 의미 있는 기준값을 빼 중심화할 수 있습니다. 예를 들어 X−5를 사용하면 새 절편은 학습시간 5시간에서의 예측 평균이 되어 설명하기 쉬워집니다.

중심화 예시

점수=52+4.2×학습시간을 학습시간 5시간 중심으로 쓰면 점수=73+4.2×(학습시간−5)입니다. 기울기는 같고 절편만 5시간의 평균점수로 바뀝니다.

5

회귀선은 어떻게 정해지는가

잔차제곱합이 가장 작은 직선을 선택합니다

각 관측치의 잔차는 eᵢ=Yᵢ−ŷᵢ입니다. 최소제곱법은 Σeᵢ²이 가장 작은 b₀와 b₁을 선택합니다. 잔차를 제곱하므로 큰 오차가 더 큰 비용을 갖습니다.

잔차의 합은 절편이 포함된 OLS에서 0이지만, 이것만으로 적합이 좋다는 뜻은 아닙니다. 잔차가 X에 따라 곡선 패턴을 보이거나 점점 퍼지면 직선과 일정분산 가정이 자료를 놓치고 있다는 신호입니다.

출력의미
적합값 ŷᵢ회귀선이 예측한 평균
잔차 eᵢ관측값과 적합값의 차이
RSS잔차제곱의 합
잔차표준오차선 주위의 전형적인 흩어짐
6

상관계수와 무엇이 다른가

관련되지만 회귀는 방향과 단위를 갖습니다

단순회귀의 기울기는 b₁=r(sᵧ/sₓ)이므로 상관계수 r과 같은 부호를 갖습니다. 그러나 r은 −1~1의 단위 없는 대칭 지표이고, 회귀기울기는 “Y 단위/X 단위”로 X에서 Y를 예측합니다.

X와 Y를 바꾸면 상관계수는 같지만 회귀식과 예측 질문은 달라집니다. 따라서 높은 상관을 곧바로 좋은 예측이나 인과효과로 해석하지 않습니다.

항목상관단순회귀
방향성X·Y를 바꿔도 같음X로 Y를 설명
단위없음Y 단위/X 단위
주요 출력r절편·기울기·예측값
목적선형 결합의 강도평균반응 설명·예측
7

설명력과 불확실성은 어떻게 읽는가

R²·신뢰구간·검정은 서로 다른 질문입니다

R²는 Y의 전체 변동 중 회귀선이 설명한 비율입니다. 단순회귀에서는 R²=r²이지만, R²가 낮아도 작은 효과를 정밀하게 추정할 수 있고 R²가 높아도 외삽이나 교란 문제는 남습니다.

기울기의 95% 신뢰구간은 표본오차를 고려했을 때 β₁의 가능한 범위를 보여줍니다. p값은 β₁=0이라는 가정 아래 현재와 같은 결과의 비양립 정도이며, 효과의 크기나 실무 중요도를 대신하지 않습니다.

출력질문
b₁평균 변화의 방향과 크기는?
95% CI모집단 기울기의 가능한 범위는?
p값기울기 0과 자료가 얼마나 양립하는가?
Y 변동의 얼마를 직선이 설명하는가?
잔차표준오차개별 관측값은 선 주위에 얼마나 흩어지는가?
8

평균반응과 개별예측은 다릅니다

신뢰구간보다 예측구간이 더 넓습니다

X=6에서의 평균 점수를 추정할 때는 평균반응의 신뢰구간을 사용합니다. 반면 새 학생 한 명의 점수를 예측할 때는 회귀선 불확실성에 학생별 잔차 변동까지 더한 예측구간이 필요합니다.

두 구간 모두 X의 평균 근처에서 가장 좁고 끝으로 갈수록 넓어집니다. 관측 범위 밖에서는 관계 형태 자체의 불확실성까지 커지므로 계산된 구간만 믿고 외삽하지 않습니다.

구간대상상대적 폭
평균반응 신뢰구간해당 X 집단의 평균 Y좁음
개별값 예측구간새 관측치 한 개의 Y넓음
9

분석은 어떻게 이루어지는가

그림에서 시작해 적합·진단·해석으로 이어갑니다

먼저 분석 단위와 X·Y의 정의, 측정시점을 확인하고 산점도로 범위·형태·이상점을 봅니다. 적합 후에는 계수표만 읽지 말고 잔차와 영향점을 확인합니다.

예측이 목적이면 새 자료나 교차검증에서 RMSE·MAE를 평가합니다. 설명이 목적이면 기울기와 신뢰구간을 중심으로 보고하되, 가능한 교란변수와 인과적 한계를 명시합니다.

단계하는 일
1분석 단위·X·Y·시간 순서 정의
2결측·범위·단위와 산점도 확인
3단순회귀 적합과 계수·CI 확인
4잔차-적합값·Q-Q·영향점 진단
5평균반응 또는 개별예측 구간 계산
6목적에 맞는 성능과 한계 보고
10

대표 사례

주당 학습시간으로 시험점수를 설명합니다

학생 120명의 주당 학습시간과 시험점수를 분석해 점수=52.0+4.2×학습시간을 얻었다고 합시다. 학습시간 기울기의 95% CI는 [3.1, 5.3], R²=.36, 잔차표준오차는 8.4점이었습니다.

출력해석
절편52.0점0시간의 예측 평균점수
기울기4.2점/시간1시간당 평균 4.2점 증가
95% CI[3.1, 5.3]가능한 평균 증가 범위
.36점수 변동의 36% 설명
잔차표준오차8.4점선 주위의 전형적 오차

결과 해석

학습시간이 1시간 길수록 시험점수는 평균 4.2점 높았고(95% CI 3.1~5.3), 학습시간은 점수 변동의 36%를 설명했습니다. 수면·사전성취도 같은 교란요인을 통제하지 않은 이변량 관계이므로 인과효과로 단정하지 않습니다.

11

가정과 주의점

선형성·독립성·등분산성·영향점을 확인합니다

선형성은 E(Y|X)가 직선이라는 가정입니다. 관측치가 독립적이지 않거나 잔차분산이 X에 따라 달라지면 표준오차가 부정확할 수 있습니다. 정규성은 X나 Y 자체가 아니라, 주어진 X에서 오차분포에 관한 추론 가정입니다.

높은 지렛값을 가진 관측치는 X가 멀리 떨어져 회귀선을 크게 움직일 수 있습니다. Cook’s D와 민감도 분석으로 특정 점을 제외했을 때 결론이 얼마나 달라지는지 확인하되, 불편한 관측치를 근거 없이 삭제하지 않습니다.

문제신호대응
비선형성잔차의 곡선 패턴변환·다항항·스플라인
이분산성깔때기형 잔차강건 표준오차·변환
비독립성군집·반복측정혼합모형·GEE 등
영향점높은 leverage·Cook’s D자료 확인·민감도 분석
외삽새 X가 관측범위 밖범위 제한·추가 자료
12

단순회귀에서 다중회귀로

기울기에 다른 변수의 차이가 섞일 수 있습니다

단순회귀 기울기는 X와 Y의 조정하지 않은 이변량 관계입니다. 수면시간이 학습시간과 점수 모두에 관련된다면 학습시간 계수에 수면의 차이가 섞일 수 있습니다.

다중회귀는 관련된 다른 변수를 함께 넣어 조건부 관계를 추정하지만, 변수를 많이 넣는다고 자동으로 인과효과가 되는 것은 아닙니다. 통제변수는 연구 질문과 시간 순서, 교란 구조를 바탕으로 정해야 합니다.

모형 확장의 기준

질문이 “X와 Y가 함께 움직이는가?”라면 단순회귀가 출발점입니다. 질문이 “다른 조건이 같을 때 X의 관계는?”이라면 다중회귀와 적절한 연구 설계가 필요합니다.

13

직접 해보기

기울기와 X가 예측 평균을 어떻게 바꾸는지 봅니다

기울기를 양수·0·음수로 바꾸고 같은 X에서 예측값이 어떻게 달라지는지 확인해 보세요. 이 계산은 회귀선 위의 평균반응이며, 새 개인의 실제값에는 잔차 변동이 추가됩니다.

단순선형회귀 인터랙티브 랩

관계·잡음·영향점을 바꾸며 회귀선, 잔차와 설명력이 동시에 어떻게 변하는지 확인하세요.

X

조작할 때 그래프의 위치·모양·오류 구조를 먼저 보세요.

ŷ=50+b₁X

예측 평균 50.0점

b₁=0.0점/단위, X=5.0이므로 절편 50에서 0.0점 달라집니다.

확인할 것

한 조절값만 먼저 움직인 뒤 그래프의 어떤 부분이 변하고 무엇은 그대로인지 설명해보세요.

14

핵심 정리

단순선형회귀의 판단 규칙

요약은 아래 핵심 정리에서 확인합니다.

  • 단순회귀는 하나의 X와 연속형 Y의 조건부 평균 관계를 직선으로 요약한다.
  • 기울기는 X 1단위당 Y 평균의 변화량이며 반드시 단위와 함께 읽는다.
  • 절편은 X=0이 자료 범위 안에서 의미 있을 때 해석한다.
  • R²·신뢰구간·잔차표준오차는 서로 다른 질문에 답한다.
  • 평균반응 신뢰구간과 새 관측값 예측구간을 구분한다.
  • 잔차·영향점·외삽과 교란 가능성을 확인한 뒤 결론을 제한한다.
15

더 깊이 알아보기

직선 하나에서 더 풍부한 모형으로 확장합니다

다음 연결

결과에 영향을 주는 조건이 여러 개라면 다중회귀에서 다른 변수를 통제한 부분효과와 다중공선성을 살펴봅니다.

주제핵심 내용
최소제곱 기하잔차제곱합을 최소화하는 직선
강건 표준오차이분산성에서 표준오차 보정
비선형 회귀다항항·스플라인으로 곡선 표현
다중회귀다른 변수를 통제한 조건부 계수
인과추론설계와 교란 통제를 통한 효과 추정
다음: 다중회귀·다중공선성