廣義線性模型在定價中的應用
/ G-L-M /
尋找相對系數的舊辦法是一次只看一個費率變量:按年齡把客戶分組、比較損失率;再按地域分組、再比較。麻煩在於變量相互重疊——年輕司機也往往開某些車、住某些地方——所以單向分析會把同一個效應記到幾個變量頭上,價格就出現扭曲。廣義線性模型(GLM)通過同時估計每個費率變量的效應、且每個都對其他所有變量加以調整來解決這個問題。
GLM 是普通回歸的一個靈活表親,專為誠實地擬合保險數據而設。兩個特性使它成為現代定價的主力。第一是連接函數:定價使用乘法型(對數連接)結構,於是模型自然產出可相乘的相對系數,與費率算法的運作方式相符。第二是誤差分布按數據選取:索賠次數(頻率)用泊松分布、索賠金額(嚴重度)用伽瑪分布、純保費直接用 Tweedie 分布。模型會為每個變量的每個層級返回一個相對系數,即固定其他一切時的邊際效應——例如「在已經計入車輛和地域之後,年輕司機是基準的1.6倍」。
GLM 把定價從粗糙的表格變成精細、內部一致的費率計劃,並仍是受監管行業的標準,因為其系數可解釋、可說明——你能向監管者精確展示每個因子為何如此。更新的機器學習方法(梯度提升、神經網絡)往往能更準確地預測損失,但更難解釋、也更難辯護為「不存在不公平歧視」,所以常被用來佐證或挑戰一個 GLM,而非直接釐定報備費率。誠實的提醒:GLM 仍然只在數據中找到關聯,而非原因,並且它會忠實地復現餵給它的歷史數據中固化的任何偏見。
對車險數據擬合一個頻率 GLM(泊松、對數連接)估計出:在固定車輛和地域後,年輕司機的相對系數為1.60。另用一個伽瑪 GLM 擬合嚴重度;把兩者相乘(或擬合一個 Tweedie)即得純保費相對系數。
GLM 一次估計每個變量的相對系數,每個都對其餘變量加以調整。
GLM 找到的是相關而非因果,並會復現訓練數據中的偏見。機器學習更高的預測準確性本身並不足夠——費率還必須可解釋且不存在不公平歧視。