假設均值的變異數
/ abbreviated VHM /
想像一個組合裡所有司機,按各自真實、隱藏的事故率排成一列。一個安全的司機真實每年造成 0.1 起事故;一個魯莽的真實每年 0.8 起。若人人相同,這些真實費率就會全都一樣,從個體記錄裡也學不到任何東西。正因為它們散開了——風險真有差異——經驗費率才有價值。假設均值的變異數 VHM,衡量這些真實的、每個風險的均值散開得有多寬。
每個風險都有一個假設均值:若你知道它的類型 theta,它會產生的預期理賠,記作 E[理賠 | theta]。當 theta 在風險母體中變動時,這個隱藏均值也隨之變動,而 VHM = Var( E[理賠 | theta] ) 就是那份變動的變異數——即「組間」或「訊號」那一塊。舉例:若一半司機真實平均 0.2 起理賠、一半真實平均 0.6 起,則假設均值以等機率取 0.2 與 0.6,其均值為 0.4,VHM = 0.5(0.2 - 0.4)^2 + 0.5(0.6 - 0.4)^2 = 0.04。
VHM 是 Bühlmann 信度的第二個結構參數,也正是它使「信任一個個體」這件事變得有道理。VHM 大意味著風險確實不同,於是個體自身的記錄攜帶真正的訊號——這會把 Bühlmann 常數 k = EPV/VHM 拉低、把信度 Z 拉高。若 VHM 為零,所有風險都相同,k 為無窮,Z 為零,你就(正確地)只用集合體均值。從資料中估計 VHM 頗為微妙,因為它是用總的觀測散布減去組內雜訊得到的,偶爾會算出負數,必須截斷為零。
一組司機裡一半真實平均每年 0.2 起理賠,一半真實平均 0.6 起。假設均值為 0.2 與 0.6(總均值 0.4),故 VHM = 0.5(0.2-0.4)^2 + 0.5(0.6-0.4)^2 = 0.04。
VHM 捕捉的是各風險「真實均值」的散布——正是這份訊號讓個體資料值得信任。
VHM 的經驗估計可能為負,因為它是總散布減去組內雜訊;慣例將其截斷為零,從而強制 Z = 0(僅用集合體)。出現負估計,本身就提示風險之間也許差異不夠大,難以可信地區分。