深度學習理論
雙重下降(double descent)
古典統計畫出一條 U 形曲線:當你增加容量時,測試誤差先降後升,於是你被告誡千萬別衝過頭。雙重下降說,故事並沒有就此打住。如果你把模型繼續放大,越過它能把訓練資料完全配適的那一點——內插門檻——測試誤差會升到一個尖峰,然後出人意料地又降下來,而且往往降到所有情況中最低的水準。
這個尖峰落在有效參數量大致等於訓練樣本數的地方。在那裡,內插解是被「逼」出來的、很脆弱,於是變異數爆炸。越過門檻之後,把資料完美配適的方式有很多種,而最佳化器的隱式偏好會挑出一個平滑、低範數的解,因此泛化得很好。同樣的形狀不只出現在模型大小上,也出現在訓練時間(逐輪)與資料集大小(逐樣本)這兩條軸上。
雙重下降把古典的偏差—變異數圖像,與「巨大網路竟然泛化得好」這個現代觀察調和起來。它並不是在反駁 U 形曲線,而是延伸它:U 形曲線是欠參數化的那一半,而第二段下降統治著過參數化的那一半。
\text{Risk}(p)\ \text{peaks at}\ p \approx n,\ \text{then decreases for}\ p \gg n
風險作為參數量 p 的函數,在內插門檻 p≈n(樣本數)附近飆升,之後再次下降。
尖峰的位置、甚至是否存在,都取決於參數化與正則化;足夠強的顯式正則化可以把它完全壓平。
又稱
另見