機器學習

偏差-變異權衡(bias-variance tradeoff)

/ BY-us VAIR-ee-uns TRADE-off /

偏差-變異權衡,解釋了一個模型為何會以兩種相反的方式失敗,以及為何修好一頭往往會讓另一頭變糟。偏差,是「太簡單」帶來的誤差——模型太死板,抓不住真正的規律,就像用一條直線去穿過明明是彎的資料。變異(方差),是「太敏感」帶來的誤差——模型會隨著它碰巧拿來訓練的那批例子而劇烈搖擺,去追逐每一個起伏和顫動。機器學習的藝術,就在於找到這兩者之間的甜蜜點。

用一幅日常畫面來想:想像幾個弓箭手射靶。一個高偏差的弓箭手,箭簇密密地扎在一起,卻一致地偏向一邊——穩,卻穩穩地偏。一個高變異的弓箭手,箭散落在靶心周圍——有時正中紅心,有時偏得離譜,毫無可靠性。兩種你都不想要。你想要的是既靠近中心、又扎得緊的箭,而通常你沒法同時把這兩樣都做到完美。

權衡本身就在這裡。把模型造得更複雜——更多參數、更大靈活度——你壓低了偏差,卻抬高了變異:它現在能擬合真正的規律,但也開始擬合雜訊(過擬合)。把它造得更簡單,你壓低了變異,卻抬高了偏差:它不再追逐雜訊,但可能錯過真正的規律(欠擬合)。經典的目標,是把兩者平衡好,使在未見資料上的總誤差最小。誠實的現代告誡是:在海量資料上訓練的超大模型,有時會偏離這條曲線的簡單版本,所以請把它當成一條結實的直覺,而非一條鐵律。

擬合房價:一條水平直線對什麼都視而不見(高偏差,欠擬合)。一條瘋狂的曲線穿過過去的每一筆成交,把訓練資料釘得死死的,卻對下一套房子預測出一堆胡話(高變異,過擬合)。一條平緩傾斜、抓住了趨勢卻不追逐每個點的線,通常泛化得最好。

太死板會錯過規律,太搖擺會追逐雜訊。要瞄準兩者之間。

這裡的「偏差」是過度簡化造成的統計誤差——不是社會或倫理上的偏見,那是另一回事(也同樣嚴重)。兩者共用一個詞,含義卻不同。

又稱
bias variance dilemma偏差-方差权衡偏差-變異權衡偏差与方差的取舍