(a,b,1)类分布
/ ay-bee-one class /
真实理赔数据中,零理赔的保单数量常常很特别——有时零的数量远超泊松的预测(很多人就是从不理赔),偶尔又会遇到零根本不可能出现、因而完全不需要零的情形。普通的(a,b,0)分布无法自由地调整零概率。(a,b,1)类解决了这个问题:它让你把“零的概率”设成数据所要求的任何值,同时其余部分仍保持一条干净的递推关系。
从机制上说,(a,b,1)类使用同样的线性递推P(N=k)/P(N=k-1)=a+b/k,但只从k=2起生效,把零处的概率P(N=0)留作一个由你单独选定的自由量。k=1及以上的概率随后被重新标定,以保证整体之和为1。两个重要成员:零截断分布把P(N=0)设为0(用于至少必有一件的情形,例如你只观察到理赔者),零调整分布则把P(N=0)设为某个选定的值,可高于或低于原始模型给出的值。泊松、二项和负二项都有这样的零截断和零调整版本。
这个类之所以重要,是因为零的数量往往是保险频率表中最关键、也最容易失真的部分——想想牙科或保修数据,绝大多数人从不理赔。能在不放弃熟悉的泊松或负二项形状的前提下调校P(N=0),会带来好得多的拟合。而且关键在于,(a,b,1)的成员仍可输入潘哲递归(仅在第一步作一点小修改),因此总损失计算依然精确。需要提醒的是:拟合零的自由很强大,却也可能掩盖更深层的模型设定错误——如果零和尾部都不对,那么可能需要一个更丰富的模型,而不仅仅是零调整。
保修数据显示96%的产品从不理赔,但拟合出的泊松只预测90%为零。精算师没有抛弃泊松,而是改用零调整泊松:直接令P(N=0)=0.96,再让原始泊松递推去刻画剩下4%中1件、2件、3件以上理赔的相对概率——这对那一大堆零的拟合好得多。
自由设定零概率,其余部分仍用递推——这就是(a,b,1)的思路。
零调整只调整零处的概率;它本身并不能修正错误的尾部。如果零的数量和上尾都拟合不佳,对一个本就错误的母分布做零调整,只是用一个问题去掩盖另一个问题。