廣義線性模型(GLM)
/ JEN-er-al-ized; gee-el-em /
普通迴歸假定你要預測的東西可以是任意數字、沿一條直線上下漂移、並以恆定的散佈散開。保險資料卻拒絕如此乖巧:理賠次數是非負的整數,理賠金額偏斜且嚴格為正,而機率必須落在 0 與 1 之間。廣義線性模型正是那個優雅的修補——它保留了我們熟悉的「把加權預測變數相加」的機器,卻使之能適應這些棘手的真實結果。毫不誇張地說,它是現代精算定價的主力。
GLM 以兩個相互關聯的方式放寬了普通迴歸。第一,它允許結果服從指數族中的任意分佈——計數用卜瓦松、正值偏斜金額用伽瑪、是非用二項——而不強行套用鐘形曲線。第二,它通過一個連結函數把預測變數與結果相連:它不直接對均值建模,而是對變換後的均值建模,g(均值) = a + b1*x1 + b2*x2 + ……。對數連結是精算的最愛,因為它讓各預測變數相乘而非相加:每個因素都變成一個把基準費率上下縮放的相對係數。係數由最大概似擬合。於是頻率模型可能是帶對數連結的卜瓦松 GLM,嚴重度模型是帶對數連結的伽瑪 GLM;二者相乘便重建出純保費。
個人險種的保險公司正是這樣釐定費率的:用一個卜瓦松 GLM 描述你多久理賠一次,用一個伽瑪 GLM 描述每筆理賠花費多少,而年齡、車型、地域等費率變數則作為乘性相對係數進入。GLM 之所以備受推崇,是因為它可解釋(每個係數都有清晰含義)、在統計上有原則,並且能為要求「看清為什麼某位司機要多付錢」的監管機構所接受。誠實的局限是:GLM 仍然假定建模者選對了分佈、連結函數與變數;它只有在你親手放入交互項時才能捕捉交互作用;而且像一切迴歸一樣,它顯示的是關聯,而非因果。
某車險公司為理賠頻率擬合了一個帶對數連結的卜瓦松 GLM。「城市地域」擬合出的係數為 0.18,於是 e^0.18 = 1.20:模型預測城市司機理賠頻率高出 20%,這是一個可直接插入費率演算法的、乾淨的乘性相對係數。
採用對數連結時,每個 GLM 係數取指數後,就變成一個乘性的費率相對係數。
GLM 仍然只是一個擬合出來的模型:它假定所選的分佈與連結函數是對的,且只能找到其變數與項所允許的關係。它不會發現你未曾指定的因果或交互作用。