深度學習理論

梯度下降的隱式正則化(implicit regularization of gradient descent)

當模型的參數比資料還多時,會有無限多組設定能把訓練損失壓到零,但梯度下降並不是隨機挑一組。在沒有顯式懲罰的情況下,最佳化器仍然偏好某些特定的解——通常是小範數、大間隔或平坦的解。這種沉默的偏好烙印在動力學裡、而非目標函數裡,就是梯度下降的隱式正則化,也是「未加正則化的網路為何能泛化」的主要候選解釋。

這種偏好有時能被精確釘住。對可分的邏輯迴歸做梯度下降,其方向會收斂到最大間隔(即最小 L2 範數)的分類器。對矩陣分解,它會漂向低核範數,這是一種隱式的低秩先驗。究竟哪一個範數被最小化,微妙地取決於損失、參數化、初始化尺度、甚至步長——並不存在一個梯度下降永遠會縮小的萬用量。

這重新定義了深度學習中的泛化:提供歸納偏好的是架構與演算法,而不是外加的正則項。誠實的限定是:除了少數可解析的模型之外,隱式偏好只被部分刻畫,因此它目前仍比較像一條指導原則,而非一套封閉的理論。

又称
implicit bias隱式正則化隱式偏好