零调整分布
许多真实的理赔件数数据有个奇怪的特点:零理赔的保单数量与标准泊松或负二项的预测对不上。往往零远多于预期(大多数人根本从不理赔),偶尔又更少甚至没有(在至少必有一件的情形下)。零调整分布是一种干净的办法:保留一个熟悉的计数模型,同时把零的概率重设到与现实相符。
它从一个母分布(泊松、二项或负二项)出发,把P(N=0)替换为一个选定的值,再把所有正件数的概率按比例重新标定,使整体之和仍为1。如果选定的零概率高于母分布的,你得到一个零膨胀模型(多出来的零);如果把它恰好设为零,你得到一个特例,称为零截断(用于没有事件不可能被观察到的情形,例如只针对理赔者的数据)。件数1、2、3……之间的相对形状继承自母分布;改变的只是零上的权重以及整体的缩放。这使零调整分布成为(a,b,1)类的一员。
凡是零的数量大而重要的地方,零调整就很要紧——牙科保险、延长保修,以及许多绝大多数人从不理赔的低频险种,把P(N=0)弄对就主导了整个拟合。从实用角度看,它让你保留方便的泊松或负二项机器(包括潘哲递归),同时诚实地拟合那一大堆零。诚实的提醒是:调整零是一个有针对性的修补,而非万灵药。如果数据在尾部和在零处都不对,那么对一个设定错误的母分布做零调整,只是在一个未被纠正的错误之上再叠一层修正;你仍应检查整体拟合,而不只是看零这一格。
一份牙科业务的母泊松(lambda=0.5)预测P(N=0)=e^(-0.5)=0.607,但数据显示75%的成员分文不报。一个零调整泊松把P(N=0)设为0.75,并把1、2、3……件理赔的概率按泊松原有的相对比例缩小、去分摊剩下的25%——与观测到的那一大堆零匹配得好得多。
把零的概率重设到与数据相符;正件数仍沿用母分布的形状。
零调整只纠正零这一格。如果母模型在尾部也错了,修正零只会掩盖这一点;务必在所有件数上验证拟合,而不只看“无理赔”的概率。