费率厘定与定价

广义线性模型在定价中的应用

/ G-L-M /

寻找相对系数的旧办法是一次只看一个费率变量:按年龄把客户分组、比较损失率;再按地域分组、再比较。麻烦在于变量相互重叠——年轻司机也往往开某些车、住某些地方——所以单向分析会把同一个效应记到几个变量头上,价格就出现扭曲。广义线性模型(GLM)通过同时估计每个费率变量的效应、且每个都对其他所有变量加以调整来解决这个问题。

GLM 是普通回归的一个灵活表亲,专为诚实地拟合保险数据而设。两个特性使它成为现代定价的主力。第一是连接函数:定价使用乘法型(对数连接)结构,于是模型自然产出可相乘的相对系数,与费率算法的运作方式相符。第二是误差分布按数据选取:索赔次数(频率)用泊松分布、索赔金额(严重度)用伽玛分布、纯保费直接用 Tweedie 分布。模型会为每个变量的每个层级返回一个相对系数,即固定其他一切时的边际效应——例如“在已经计入车辆和地域之后,年轻司机是基准的1.6倍”。

GLM 把定价从粗糙的表格变成精细、内部一致的费率计划,并仍是受监管行业的标准,因为其系数可解释、可说明——你能向监管者精确展示每个因子为何如此。更新的机器学习方法(梯度提升、神经网络)往往能更准确地预测损失,但更难解释、也更难辩护为“不存在不公平歧视”,所以常被用来佐证或挑战一个 GLM,而非直接厘定报备费率。诚实的提醒:GLM 仍然只在数据中找到关联,而非原因,并且它会忠实地复现喂给它的历史数据中固化的任何偏见。

对车险数据拟合一个频率 GLM(泊松、对数连接)估计出:在固定车辆和地域后,年轻司机的相对系数为1.60。另用一个伽玛 GLM 拟合严重度;把两者相乘(或拟合一个 Tweedie)即得纯保费相对系数。

GLM 一次估计每个变量的相对系数,每个都对其余变量加以调整。

GLM 找到的是相关而非因果,并会复现训练数据中的偏见。机器学习更高的预测准确性本身并不足够——费率还必须可解释且不存在不公平歧视。

又称
generalized linear modelsGLM ratemaking广义线性模型定价廣義線性模型定價