(a,b,0)类分布
/ ay-bee-zero class /
精算师注意到,三种最常用的计数分布——泊松、二项、负二项——都有一个隐藏的家族相似性。发生k件理赔的概率与发生k-1件的概率之间存在一条简单的关系,而且这三者用的是同一种形状的关系。按这条共享的递推关系把它们归为一组,就得到了(a,b,0)类:一个由单一递推关系定义的、小而整洁的频率分布族。
其定义规则是:相邻概率之比关于k是线性的——P(N=k)除以P(N=k-1)等于a加上b除以k,对k=1、2、3……成立,其中a、b是两个常数。标号中的“零”表示递推从k=0处的自然值开始,无需任何特殊调整。a、b的不同符号组合挑出不同成员:a=0给出泊松,a为负给出二项,a在0与1之间给出负二项(及其几何分布特例)。所以仅靠a、b两个数,就编码出你手上是哪一种熟悉的分布。
为什么要给这个族命名?因为定义它的那条递推关系,恰恰正是让潘哲递归得以运作的关键:任何属于(a,b,0)的频率,配上一个离散化的严重度,就能一步一步地构建出总损失分布,从而避免暴力卷积。所以(a,b,0)类不是花架子——它是把频率-严重度建模变成一种快速、精确计算的入口。诚实的局限是:只有这几个特定分布属于(a,b,0);如果你的数据需要——比如——一个被夸大的零的数量,你就必须改用(a,b,1)类。
对于lambda=4的泊松分布,递推关系为P(k)/P(k-1)=4/k,对应a=0、b=4。于是P(1)/P(0)=4、P(2)/P(1)=2、P(3)/P(2)=4/3——每个概率都由上一个经一次乘法得到,这正是潘哲递归所利用的那一步。
通过P(k)/P(k-1)=a+b/k,两个常数a、b就辨认出泊松、二项或负二项分布。
(a,b,0)类恰好只含三种分布(泊松、二项、负二项)。它不是一个可以随意伸缩的族——如果真实数据表现出,比如,远过多的零,你就无法停留在(a,b,0)中,而要转向(a,b,1)类。