多元迴歸
/ MUL-tih-pul ree-GRESH-un /
穿過「年齡對花費」的一條直線很有用,但真實的結果同時依賴許多因素。醫療花費隨年齡上升,也隨吸菸、地區與慢性病而變化。多元迴歸讓所有這些預測變數在一個方程裡共同起作用,於是你可以提出那個強有力的問題:在其他一切保持不變的前提下,每個因素單獨貢獻了多少?
該模型把簡單直線擴展到多個預測變數:y = a + b1*x1 + b2*x2 + b3*x3 + 誤差。每個係數 b,是當其對應預測變數變化一單位、而其餘預測變數保持不變時 y 的變化量——「保持其餘不變」這個短語至關重要。最小平方仍然選取使總平方誤差最小的那組係數,只不過現在是在許多維度上同時進行。例如,花費 = 400 + 70*年齡 + 1,200*吸菸者 表示:年齡每歲加 70,吸菸者再加 1,200,每一項都是在扣除另一項之後衡量的。把某一因素的效應從其餘因素的糾纏中分離出來的這種能力,正是該技術如此受重視的原因。
多元迴歸是精算師用來釐定費率的 GLM 的直系祖先——在那裡,幾十個費率變數(年齡、車型、地域、既往理賠)共同決定一個保費相對係數。誠實的提醒在此更為尖銳。當預測變數之間本身高度相關時(多重共線性),它們各自的係數會變得不穩定、難以解釋,即便整體預測仍然良好。而不斷堆入更多變數總會把樣本內擬合往上推,誘發過度配適;這正是為什麼調整後 R 平方與各種模型選擇準則懲罰複雜度,而不是獎勵原始的擬合度。
某車險公司把理賠成本同時對年齡、年行駛里程與地域做迴歸。擬合出的係數讓它能夠說:青少年司機成本更高是源於年齡本身——並把這一點從「青少年也往往在某些區域行駛」這一事實中分離出來。
每個係數都在保持其他預測變數不變的情況下,分離出單一因素的效應。
當兩個預測變數高度相關時,它們各自的係數可能劇烈擺動,甚至改變符號;模型或許仍預測良好,但各自的效應已不再可信。