損失模型:頻率與嚴重度

負二項頻率模型

假設你對汽車理賠試用了泊松模型,卻發現它總是低估糟糕年份、高估平靜年份——真實件數的擺動比泊松允許的更劇烈。原因通常是司機並非千篇一律:大多數人小心,少數人魯莽,而你事先並不知道誰是誰。負二項頻率模型恰好刻畫了這種額外的離散。

看清它最乾淨的方式是:設想每位保單持有人都有自己的泊松速率lambda,但lambda本身因人而異、服從一個伽馬分布(謹慎者lambda小,魯莽者lambda大)。對這種隱藏的差異取平均,所得的件數分布就是負二項分布。它的關鍵特徵是方差大於均值——即過度離散——由一個額外的形狀參數控制。當該參數變大時,負二項趨近泊松;把它調小,高件數的尾部就變得更重。

實務中,只要理賠件數表現出泊松無法解釋的更大變動性,負二項就是首選的升級方案,而風險異質的真實業務大多如此。它屬於(a,b,0)類(a為正),因此可以直接套入計算總損失的潘哲遞迴。誠實的提醒是:你數據中的過度離散並不能證明負二項就是「真相」;它只是一種合理的機制(未觀測到的異質性),但理賠的傳染或扎堆同樣會放大方差,優秀的分析師會去檢驗擬合優度,而不是想當然地接受這個故事。

一份車險業務平均每份保單0.2件理賠,但件數的觀測方差為0.5——遠高於均值,所以泊松(強制方差=均值=0.2)失效。一個均值為0.2、並把額外離散參數調到使方差等於0.5的負二項分布,就能恰當地擬合好年壞年之間的擺動。

讓泊松速率在保單間變化,就得到負二項分布——此時方差超過均值。

過度離散並不能唯一地指向負二項分布。未觀測到的異質性是一種原因;理賠扎堆或傳染是另一種。這個模型擬合的是症狀(方差高於均值),但背後的機制仍值得查證。

又稱
NB frequency modelPoisson-gamma mixture负二项计数模型卜瓦松-伽馬混合