信度理论

假设均值的方差

/ abbreviated VHM /

想象一个组合里所有司机,按各自真实、隐藏的事故率排成一列。一个安全的司机真实每年造成 0.1 起事故;一个鲁莽的真实每年 0.8 起。若人人相同,这些真实费率就会全都一样,从个体记录里也学不到任何东西。正因为它们散开了——风险真有差异——经验费率才有价值。假设均值的方差 VHM,衡量这些真实的、每个风险的均值散开得有多宽。

每个风险都有一个假设均值:若你知道它的类型 theta,它会产生的预期理赔,记作 E[理赔 | theta]。当 theta 在风险总体中变动时,这个隐藏均值也随之变动,而 VHM = Var( E[理赔 | theta] ) 就是那份变动的方差——即“组间”或“信号”那一块。举例:若一半司机真实平均 0.2 起理赔、一半真实平均 0.6 起,则假设均值以等概率取 0.2 与 0.6,其均值为 0.4,VHM = 0.5(0.2 - 0.4)^2 + 0.5(0.6 - 0.4)^2 = 0.04。

VHM 是 Buhlmann 信度的第二个结构参数,也正是它使“信任一个个体”这件事变得有道理。VHM 大意味着风险确实不同,于是个体自身的记录携带真正的信号——这会把 Buhlmann 常数 k = EPV/VHM 拉低、把信度 Z 拉高。若 VHM 为零,所有风险都相同,k 为无穷,Z 为零,你就(正确地)只用集合体均值。从数据中估计 VHM 颇为微妙,因为它是用总的观测散布减去组内噪声得到的,偶尔会算出负数,必须截断为零。

一组司机里一半真实平均每年 0.2 起理赔,一半真实平均 0.6 起。假设均值为 0.2 与 0.6(总均值 0.4),故 VHM = 0.5(0.2-0.4)^2 + 0.5(0.6-0.4)^2 = 0.04。

VHM 捕捉的是各风险“真实均值”的散布——正是这份信号让个体数据值得信任。

VHM 的经验估计可能为负,因为它是总散布减去组内噪声;惯例将其截断为零,从而强制 Z = 0(仅用集合体)。出现负估计,本身就提示风险之间也许差异不够大,难以可信地区分。

又称
VHMbetween-risk variance假设均值方差组间方差