어떤 결과는 예/아니오가 아니라 시계입니다. 고객이 이탈하기까지 얼마나? 부품이 고장 나기까지 몇 달? 환자가 재발하는 때는? 이것들은 사건까지 시간 질문이며, 특정한 방식으로 보통의 도구를 깨뜨립니다: 연구가 끝나는 시점에 많은 대상이 아직 사건을 겪지 않았습니다.
그 끝나지 않은 데이터가 생존분석이 존재하는 이유 전부입니다. 그 대상들을 버릴 수도(진짜 정보를 담고 있음) 사건이 일어난 척할 수도 없습니다. 생존분석은 그것들을 올바르게 쓰는 family입니다.
Note
중도절단: 무시할 수 없는 데이터
연구가 끝날 때 여전히 활성인 구독자는 이탈하지 않았지만 — 언제 이탈할지는 모릅니다. 그들을 삭제하면 결과가 조기 이탈자 쪽으로 편향되고, 이탈로 취급하면 그냥 틀립니다. 중도절단은 사건을 지어내지 않고 그들의 부분 정보를 유지합니다.
Watch out
생존 곡선: 카플란-마이어
카플란-마이어 추정량은 사건까지 시간 데이터를 생존 곡선으로 바꿉니다 — 위 차트처럼 각 시점에 여전히 사건 없는 대상의 비율로, 사건마다 계단으로 하강합니다. 가장 먼저 그릴 것이며, 두 곡선을 비교하는 것이 흔히 분석 전부입니다.
- 각 계단 하강은 사건을 표시; 평평한 구간은 사건 없는 기간
- 중도절단 대상은 이탈하는 순간 자동 처리
- 중앙 생존 — 곡선이 50%를 지나는 곳 — 이 전형적 시간을 요약
두 곡선이 정말 다른지 — 처치군 vs 대조군, 요금제 A vs B — 검정하려면, 로그순위 검정이 단일 지점이 아니라 전체 타임라인에 걸쳐 비교합니다.
예측변수 더하기: Cox 회귀
카플란-마이어 곡선은 집단을 비교하고, Cox 비례위험 회귀는 예측변수를 들여옵니다. 중도절단을 내내 다루면서 각 변수가 위험 — 사건의 순간 위험 — 을 어떻게 바꾸는지 추정합니다.
| 위험비 | 의미 |
|---|---|
| 1보다 큼 | 높은 위험 — 사건이 더 빨리 발생 |
| 1과 같음 | 타이밍에 영향 없음 |
| 1보다 작음 | 낮은 위험 — 사건이 지연 |
위험비 1.5는 그 예측변수가 어느 순간이든 사건 위험을 약 50% 높인다는 뜻 — 회귀 계수의 생존 대응물입니다.
기초 너머
- 경쟁위험 — 한 종류 이상의 사건이 일어날 수 있고(예: 이탈 vs 업그레이드) 하나가 다른 것을 막을 때
- 제한평균생존시간(RMST) — 어떤 지평까지의 평균 사건 없는 시간, 곡선이 교차할 때 해석 가능한 요약
- 시변 공변량 — 추적 중에 바뀌는 예측변수
SKARI Statistical Lab의 생존분석
SKARI의 Statistical Lab은 생존을 독립된 family로 다루며, 전체 사건까지 시간 도구와 중도절단 처리를 갖췄습니다.
- 중앙 생존과 로그순위 검정이 있는 카플란-마이어 곡선
- 위험비가 있는 Cox 비례위험 회귀
- 여러 사건 유형이 경쟁할 때의 경쟁위험 모델
- 해석 가능한 요약을 위한 제한평균생존시간(RMST)
- 조용히 버리지 않고 내내 올바르게 처리되는 중도절단
Takeaway
자주 묻는 질문
그냥 기간에 회귀를 돌리면 안 되나요?
중도절단 때문입니다. 보통의 회귀는 아직 사건을 겪지 않은 대상을 쓸 수 없고, 그들을 버리면 결과가 편향됩니다. 생존 방법은 그들의 부분 정보를 씁니다.
위험비란?
예측변수 한 단위당 순간 사건 위험의 곱셈적 변화. 1보다 크면 사건까지 더 빠름, 작으면 더 느림.
카플란-마이어와 Cox 중?
집단 곡선을 기술·비교하려면 카플란-마이어, 다른 것을 통제하며 하나 이상 예측변수의 효과를 추정하려면 Cox 회귀입니다.
핵심 요약
결과
시간
사건까지
처리
중도절단
미완 데이터
기술
K-M
생존 곡선
예측
Cox
위험비
생존분석은 다른 family가 '여부만' 답할 수 있는 곳에서 '얼마나 오래?'에 답합니다. 중도절단 대상을 유지하고, 카플란-마이어 곡선을 그리고, 로그순위로 비교하고, Cox로 예측변수를 모델링하면 — 사건까지 시간 데이터가 마침내 전체 신호를 내놓습니다.
Takeaway
관계 분석
Cox의 사촌, 회귀
집단 비교
고전적 집단 비교
가설검정 기초
추론 뼈대