多元回归
/ MUL-tih-pul ree-GRESH-un /
穿过“年龄对花费”的一条直线很有用,但真实的结果同时依赖许多因素。医疗花费随年龄上升,也随吸烟、地区与慢性病而变化。多元回归让所有这些预测变量在一个方程里共同起作用,于是你可以提出那个强有力的问题:在其他一切保持不变的前提下,每个因素单独贡献了多少?
该模型把简单直线扩展到多个预测变量:y = a + b1*x1 + b2*x2 + b3*x3 + 误差。每个系数 b,是当其对应预测变量变化一单位、而其余预测变量保持不变时 y 的变化量——“保持其余不变”这个短语至关重要。最小二乘仍然选取使总平方误差最小的那组系数,只不过现在是在许多维度上同时进行。例如,花费 = 400 + 70*年龄 + 1,200*吸烟者 表示:年龄每岁加 70,吸烟者再加 1,200,每一项都是在扣除另一项之后衡量的。把某一因素的效应从其余因素的纠缠中分离出来的这种能力,正是该技术如此受重视的原因。
多元回归是精算师用来厘定费率的 GLM 的直系祖先——在那里,几十个费率变量(年龄、车型、地域、既往理赔)共同决定一个保费相对系数。诚实的提醒在此更为尖锐。当预测变量之间本身高度相关时(多重共线性),它们各自的系数会变得不稳定、难以解释,即便整体预测仍然良好。而不断堆入更多变量总会把样本内拟合往上推,诱发过拟合;这正是为什么调整后 R 平方与各种模型选择准则惩罚复杂度,而不是奖励原始的拟合度。
某车险公司把理赔成本同时对年龄、年行驶里程与地域做回归。拟合出的系数让它能够说:青少年司机成本更高是源于年龄本身——并把这一点从“青少年也往往在某些区域行驶”这一事实中分离出来。
每个系数都在保持其他预测变量不变的情况下,分离出单一因素的效应。
当两个预测变量高度相关时,它们各自的系数可能剧烈摆动,甚至改变符号;模型或许仍预测良好,但各自的效应已不再可信。