生存模型与死亡率

卡普兰-迈耶估计量

/ KAP-lan MY-er /

假设你追踪一组病人(或被保生命、或机器),想直接从数据估计生存函数——而不假设任何公式。一个真实的麻烦是:你很少能观察到每个人直到他死去——有些人在研究结束时仍然活着,有些人提前退出。这些被不完整观察到的生命,称为删失。卡普兰-迈耶估计量,正是从这种凌乱、部分删失的数据中构建生存曲线的标准、无分布假设的方法。

它的做法,是逐一走过实际发生死亡的各个不同时刻,并把生存的胜算串接起来。在每个死亡时刻你问:在那一瞬之前仍受观察、处于风险中的人里,有多少比例活过了这一刻?那个比例就是 1 减去当时的「死亡数除以风险数」。估计出的生存曲线,是直到某一时刻为止所有这些比例的累乘——这正是它又被称作乘积极限估计量的原因。删失的生命只在退出之前计入风险人群,故它们会减小其后的分母,却不被当作死亡处理。结果是一条只在观测到的死亡时刻才向下跨一级的阶梯。

卡普兰-迈耶是临床试验、可靠性测试以及任何「无法等到人人死去」的生存研究的主力——「中位生存期」与「五年生存率」正是这样报告出来的。对精算师而言,它是修匀生命表的非参数伙伴:当你想让数据自己说话时很有用,但需诚实地提醒:曲线右端基于极少幸存者,并不稳固;而且它假设删失与个人的潜在风险无关。

若有 100 人处于风险中、第 6 个月死 5 人,随后剩 80 人处于风险中、第 9 个月死 4 人,则第 9 个月的 K-M 生存估计为 (1 - 5/100) x (1 - 4/80) = 0.95 x 0.95 = 0.9025。

该估计是「活过此死亡时刻」各比例的累乘,只在见到死亡时才向下跨一级。

卡普兰-迈耶假设删失是非信息性的——即退出者并不系统性地比留下者更病或更健康。若退出者有所不同(例如重病者离开了研究),曲线就会有偏。

又称
Kaplan-Meier estimatorproduct-limit estimatorKM curve乘积极限估计量K-M 估计生存曲线估计