統計、資料與建模

過度配適與模型選擇(AIC/BIC)

/ OH-ver-FIT-ing; ay-eye-see; bee-eye-see /

想像一個學生死記去年考卷的確切答案,而不去學懂這門科目。他在練習卷上拿滿分,到了真正的考試卻不及格,因為他擬合的是某一份特定考卷的怪癖,而非背後的知識。統計模型也會犯同樣的錯誤。過度配適,就是把模型造得過於精巧,以致它去追逐訓練資料中的隨機雜訊,把它擬合得漂漂亮亮,對新資料的預測卻很糟。模型選擇,正是避免此事的那門有紀律的藝術——選一個豐富到足以捕捉真實信號、卻又不過分豐富的模型。

加入更多變數或更多靈活性,總會改善對你所訓練資料的擬合;問題在於過了某一點,你擬合的就是雜訊而非信號,樣本外的表現反而變差。用來平衡擬合與複雜度的工具是資訊準則。AIC(赤池資訊準則)與 BIC(貝氏資訊準則)都取模型的對數概似,再為每個多出的參數減去一項懲罰;你偏好得分較低的模型。BIC 的懲罰隨樣本量增大,因此對複雜度懲罰得更狠,往往挑出比 AIC 更簡單的模型。不過,誠實的黃金標準是:在模型從未見過的資料上檢驗它——留出集或交叉驗證,即在一部分資料上擬合,在其餘資料上衡量誤差。

對精算師而言,這關乎真金白銀。一個帶有過多細分地域或車型類別的定價 GLM,會把去年的損失擬合得極好,然後對明年定錯價,向某些客戶錯誤收費、又流失掉那些有利可圖的客戶。AIC、BIC 與交叉驗證的全部要點,就是找到那個能夠泛化的模型,而非那個奉承歷史資料的模型。有經驗的建模者反覆唸叨一句直白的警告:對你的資料擬合得最好的模型,幾乎從來不是預測未來最好的模型;而一個簡約、可解釋的模型,通常勝過一個龐雜到無人能核查的模型。

在一個 5 變數與一個 15 變數的定價 GLM 之間抉擇時,精算師看到 15 變數模型的概似更高,但 BIC 更差(更高)。BIC 的複雜度懲罰把那多出的十個變數標記為「追逐雜訊」,於是選用更精簡的模型。

概似更高但 BIC 更差:多出的參數買到的是擬合,而非預測力。

AIC 與 BIC 是嚮導,而非裁決,且它們假定所比較的模型是在同一份資料上擬合的可比模型。檢驗過度配適最誠實的方法,永遠是模型在從未見過的資料上的表現。

又稱
AICBICmodel selection过度拟合資訊準則