机器学习

偏差-方差权衡(bias-variance tradeoff)

/ BY-us VAIR-ee-uns TRADE-off /

偏差-方差权衡,解释了一个模型为何会以两种相反的方式失败,以及为何修好一头往往会让另一头变糟。偏差,是「太简单」带来的误差——模型太死板,抓不住真正的规律,就像用一条直线去穿过明明是弯的数据。方差,是「太敏感」带来的误差——模型会随着它碰巧拿来训练的那批例子而剧烈摇摆,去追逐每一个起伏和颤动。机器学习的艺术,就在于找到这两者之间的甜蜜点。

用一幅日常画面来想:想象几个弓箭手射靶。一个高偏差的弓箭手,箭簇密密地扎在一起,却一致地偏向一边——稳,却稳稳地偏。一个高方差的弓箭手,箭散落在靶心周围——有时正中红心,有时偏得离谱,毫无可靠性。两种你都不想要。你想要的是既靠近中心、又扎得紧的箭,而通常你没法同时把这两样都做到完美。

权衡本身就在这里。把模型造得更复杂——更多参数、更大灵活度——你压低了偏差,却抬高了方差:它现在能拟合真正的规律,但也开始拟合噪声(过拟合)。把它造得更简单,你压低了方差,却抬高了偏差:它不再追逐噪声,但可能错过真正的规律(欠拟合)。经典的目标,是把两者平衡好,使在未见数据上的总误差最小。诚实的现代告诫是:在海量数据上训练的超大模型,有时会偏离这条曲线的简单版本,所以请把它当成一条结实的直觉,而非一条铁律。

拟合房价:一条水平直线对什么都视而不见(高偏差,欠拟合)。一条疯狂的曲线穿过过去的每一笔成交,把训练数据钉得死死的,却对下一套房子预测出一堆胡话(高方差,过拟合)。一条平缓倾斜、抓住了趋势却不追逐每个点的线,通常泛化得最好。

太死板会错过规律,太摇摆会追逐噪声。要瞄准两者之间。

这里的「偏差」是过度简化造成的统计误差——不是社会或伦理上的偏见,那是另一回事(也同样严重)。两者共用一个词,含义却不同。

又称
bias variance dilemma偏差-方差权衡偏差-變異權衡偏差与方差的取舍