每損失與每賠付變量
假設你的保單有500免賠額。談論保險公司賠付有兩種自然的方式。其一:「在所有發生過的損失中(包括那些我們分文未賠的小額損失),我們平均賠了多少?」其二:「只看那些大到足以觸發賠付的損失,平均每張支票是多少?」這就是每損失視角和每賠付視角,而把兩者混淆是損失建模中最常見的錯誤之一。
每損失變量考察每一次損失事件,把免賠額以下的損失賦以零賠付。在免賠額d下它是max(X-d, 0),把那些零也計入。每賠付變量則以確實發生了賠付為條件——它只考慮超過d的損失,所以它是「在X大於d的條件下的(X-d)」。每賠付的平均值高於每損失的平均值,因為每損失版本被所有那些零賠付稀釋了。從數值上看,如果30%的損失低於免賠額、分文不賠,那麼每損失均值只走到每賠付均值的70%處。兩者通過「發生賠付的概率」相聯繫。
這一區分對定價、尤其對擬合至關重要。保險數據通常是每賠付的:你只有超過免賠額的理賠記錄(低於它的損失從未上報),所以數據是左截斷的。若把數據當作每損失來擬合嚴重度模型、忽略缺失的小額損失,估計就會有偏。同樣,當你計算預期成本時,必須清楚你指的是哪一個平均:預期總成本用的是每損失期望,而「平均已賠理賠」是每賠付的。在幾乎每一項涉及免賠額的嚴重度計算之前,都必須先明確回答「是每損失還是每賠付?」。
在500免賠額下,發生了200、400、700、1500的損失。每損失賠付為0、0、200、1000,對全部四次事件取平均為300。按每賠付,則去掉兩個零,只對200和1000取平均,得600。這裡每賠付數字是每損失數字的兩倍,純粹是因為一半的損失分文不賠。
每損失把零也算進去;每賠付則以確實開出支票為條件。
真實理賠數據通常是每賠付且左截斷的——免賠額以下的小額損失從未上報。若把它們當作完整的每損失數據來擬合,就遺漏了缺失的小額損失,使嚴重度估計產生偏差。