拟合损失分布
你手上有一堆过去的理赔金额,想要一个干净的数学模型来描述它们——一条可以用来给明年定价、设定免赔额、或估计巨额损失概率的曲线。拟合损失分布,就是这样一个有章法的过程:选定一个分布族,从数据估计其参数,再检验所选曲线是否真的与你所见相符。
这是一门三步功夫。第一步,依据数据的形状挑选候选族——取正值、右偏的金额提示用对数正态、伽马、威布尔或帕累托。第二步,估计参数,最常用的是极大似然法(选出使你观测到的理赔最可能发生的参数值)或矩估计法(让模型的均值、方差与样本相匹配)。第三步,评判拟合优度:用拟合优度检验(如柯尔莫哥洛夫-斯米尔诺夫检验或卡方检验)、图形以及信息准则(AIC或BIC,奖励拟合、惩罚多余参数,以免过拟合)把拟合曲线与数据相比较。然后你挑出那个拟合良好、且不比所需更复杂的模型。
这是定价与准备金的经验内核——每一笔保费、每一笔准备金都建立在某个拟合出的损失模型之上。这里有几条诚实的警告。保险数据常被截尾和截断(你只看到免赔额以上、被限额封顶的损失),所以必须用正确的每赔付或每损失似然来拟合,而不是天真地用原始金额。拟合优度检验评判的是数据的主体,而非罕见的尾部——可代价正出在尾部,所以一个模型可能“通过”检验却在极端处依然危险。而且没有哪个拟合分布是“真的”;它只是一个有用的概括,一旦世界变化(通胀、法律、行为)将来就会出错,这正是为什么拟合要与趋势调整、专业判断和定期重新拟合配套进行。
面对2000件火灾理赔,精算师用极大似然法拟合对数正态、伽马和帕累托。对数正态的AIC最优(最低)、并通过了对主体的柯尔莫哥洛夫-斯米尔诺夫检验,但Q-Q图显示最大的几笔理赔落在对数正态尾部之下。因此对高超额层级,她叠加一条帕累托尾——对日常损失用拟合主体的族,对真正花钱的尾部用拟合尾部的族。
选定族、估计参数、再检验拟合——尤其要检验代价最大的那条尾部。
一个通过拟合优度检验的模型,仍可能在尾部严重出错,因为这类检验看重的是数据稠密的中段,而非罕见的极端。务必单独检查尾部拟合,并记住拟合出的分布是一种概括,而非真理。