生存模型與死亡率

卡普蘭-邁耶估計量

/ KAP-lan MY-er /

假設你追蹤一組病人(或被保生命、或機器),想直接從資料估計生存函數——而不假設任何公式。一個真實的麻煩是:你很少能觀察到每個人直到他死去——有些人在研究結束時仍然活著,有些人提前退出。這些被不完整觀察到的生命,稱為刪失。卡普蘭-邁耶估計量,正是從這種凌亂、部分刪失的資料中構建生存曲線的標準、無分布假設的方法。

它的做法,是逐一走過實際發生死亡的各個不同時刻,並把生存的勝算串接起來。在每個死亡時刻你問:在那一瞬之前仍受觀察、處於風險中的人裡,有多少比例活過了這一刻?那個比例就是 1 減去當時的「死亡數除以風險數」。估計出的生存曲線,是直到某一時刻為止所有這些比例的累乘——這正是它又被稱作乘積極限估計量的原因。刪失的生命只在退出之前計入風險人群,故它們會減小其後的分母,卻不被當作死亡處理。結果是一條只在觀測到的死亡時刻才向下跨一級的階梯。

卡普蘭-邁耶是臨床試驗、可靠性測試以及任何「無法等到人人死去」的生存研究的主力——「中位生存期」與「五年生存率」正是這樣報告出來的。對精算師而言,它是修勻生命表的非參數夥伴:當你想讓資料自己說話時很有用,但需誠實地提醒:曲線右端基於極少倖存者,並不穩固;而且它假設刪失與個人的潛在風險無關。

若有 100 人處於風險中、第 6 個月死 5 人,隨後剩 80 人處於風險中、第 9 個月死 4 人,則第 9 個月的 K-M 生存估計為 (1 - 5/100) x (1 - 4/80) = 0.95 x 0.95 = 0.9025。

該估計是「活過此死亡時刻」各比例的累乘,只在見到死亡時才向下跨一級。

卡普蘭-邁耶假設刪失是非資訊性的——即退出者並不系統性地比留下者更病或更健康。若退出者有所不同(例如重病者離開了研究),曲線就會有偏。

又稱
Kaplan-Meier estimatorproduct-limit estimatorKM curve乘积极限估计量K-M 估计生存曲线估计