擬合損失分布
你手上有一堆過去的理賠金額,想要一個乾淨的數學模型來描述它們——一條可以用來給明年定價、設定免賠額、或估計巨額損失概率的曲線。擬合損失分布,就是這樣一個有章法的過程:選定一個分布族,從數據估計其參數,再檢驗所選曲線是否真的與你所見相符。
這是一門三步功夫。第一步,依據數據的形狀挑選候選族——取正值、右偏的金額提示用對數常態、伽馬、威布爾或帕累托。第二步,估計參數,最常用的是極大似然法(選出使你觀測到的理賠最可能發生的參數值)或矩估計法(讓模型的均值、方差與樣本相匹配)。第三步,評判擬合優度:用擬合優度檢驗(如柯爾莫哥洛夫-斯米爾諾夫檢驗或卡方檢驗)、圖形以及資訊準則(AIC或BIC,獎勵擬合、懲罰多餘參數,以免過擬合)把擬合曲線與數據相比較。然後你挑出那個擬合良好、且不比所需更複雜的模型。
這是定價與準備金的經驗內核——每一筆保費、每一筆準備金都建立在某個擬合出的損失模型之上。這裡有幾條誠實的警告。保險數據常被截尾和截斷(你只看到免賠額以上、被限額封頂的損失),所以必須用正確的每賠付或每損失似然來擬合,而不是天真地用原始金額。擬合優度檢驗評判的是數據的主體,而非罕見的尾部——可代價正出在尾部,所以一個模型可能「通過」檢驗卻在極端處依然危險。而且沒有哪個擬合分布是「真的」;它只是一個有用的概括,一旦世界變化(通脹、法律、行為)將來就會出錯,這正是為什麼擬合要與趨勢調整、專業判斷和定期重新擬合配套進行。
面對2000件火災理賠,精算師用極大似然法擬合對數常態、伽馬和帕累托。對數常態的AIC最優(最低)、並通過了對主體的柯爾莫哥洛夫-斯米爾諾夫檢驗,但Q-Q圖顯示最大的幾筆理賠落在對數常態尾部之下。因此對高超額層級,她疊加一條帕累托尾——對日常損失用擬合主體的族,對真正花錢的尾部用擬合尾部的族。
選定族、估計參數、再檢驗擬合——尤其要檢驗代價最大的那條尾部。
一個通過擬合優度檢驗的模型,仍可能在尾部嚴重出錯,因為這類檢驗看重的是數據稠密的中段,而非罕見的極端。務必單獨檢查尾部擬合,並記住擬合出的分布是一種概括,而非真理。