JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

隱式正則化與穩定邊緣

沒有任何顯式懲罰,梯度下降卻可靠地挑出能泛化的解。本篇拆解它對低範數與平坦極小值的隱式偏好、出人意料的穩定邊緣動力學,以及決定「什麼先被學會」的譜偏差。

選擇問題

第 1 篇留給我們一個選擇問題:在無窮多個零損失內插解中,訓練可靠地挑出能泛化的那些。本節的核心假說是梯度下降的隱式正則化(implicit regularization by gradient descent)——優化器本身,在沒有任何顯式懲罰項的情況下,把解偏向某個偏好的子集。你熟悉的顯式正則化器(權重衰減(weight decay)dropout提早停止(early stopping))確實有幫助,但它們不是主角;就算全都拿掉,單純的梯度下降依然能泛化。

最乾淨的定理活在簡單模型裡。對可分的邏輯迴歸(logistic regression),梯度下降的方向會收斂到最大間隔(max-margin)解——和 SVM 會挑的那個一樣——即便損失裡根本沒有間隔項。對矩陣分解,從小初始化出發的梯度流偏向低核範數。這些都是精確的陳述:「在擬合資料的條件下,GD 暗中最小化某個範數 X。」

在可分的逻辑回归上,梯度下降的方向会收敛到与支持向量机相同的最大间隔边界。

两类点被尽可能宽的间隔分开,支持向量落在间隔边界上。

平坦極小值泛化得更好

一個互補的視角看的是盆地的形狀。平坦極小值(flat minima)假說主張:坐落在損失地景(loss landscape)中寬闊、平坦區域的解,比坐落在尖銳、狹窄區域的解泛化得更好。直覺是:平坦極小值很穩健——權重的小擾動(訓練/測試的分布偏移實際上就造成這種擾動)幾乎不改變損失,於是測試損失保持貼近訓練損失。尖銳度常以損失海森矩陣(Hessian)的最大特徵值(eigenvalues)來量測。

這不只是比喻。尖銳度感知最小化SAM)把它變成一個目標:最小化小鄰域內的最壞情況損失,明確地追求平坦,並能可量測地改善泛化。誠實的提醒是:素樸的尖銳度不具重新參數化不變性(你可以靠重新縮放權重來偽造平坦),所以真正控制泛化的精確概念至今仍有爭議——自適應與尺度不變的尖銳度量測是一個活躍的修補方向。

\min_{w}\; \max_{\lVert \epsilon \rVert_2 \le \rho} L(w+\epsilon)

锐度感知最小化用 ρ 邻域内的最坏损失代替原损失,从而显式地寻找平坦极小值。

穩定邊緣

古典優化說,全批次梯度下降只在學習率(learning rate) η 低於 2/λ 時穩定,其中 λ 是最大海森特徵值(即尖銳度(sharpness))。超過這個值,二次碗形會讓你發散。但觀察真實網路訓練,會看到更怪的事:尖銳度會上升,直到 λ 幾乎恰好達到 2/η,然後停在那裡徘徊——損失非單調地彈跳,但長期趨勢仍持續下降。這就是穩定邊緣(edge of stability)

\eta < \frac{2}{\lambda_{\max}\!\left(\nabla^2 L\right)}

经典梯度下降只有在 2/λ 以下才稳定;网络却恰好越过该阈值,停留在稳定性边缘。

教訓是:在實用學習率下,梯度下降並不是被離散化的梯度流——它活在一個真正離散、輕微不穩定的區間,小步長的連續理論看不見這裡。而這種不穩定是有產出的:把尖銳度壓在 2/η 的那個機制,正把模型推向更平坦的區域。優化與平坦極小值,是同一個故事從兩端講起。

譜偏差:先簡單後複雜

時間上也有一種隱式偏好。譜偏差,或稱頻率原則(frequency principle)說:網路先擬合目標函數的低頻、平滑成分,較晚——甚至從不——才擬合高頻的細微擺動。透過 NTK 的視角這是精確的:與大核特徵值對齊的成分,以這些特徵值決定的速率被學會,而對標準網路而言,平滑方向主宰了整個譜。

譜偏差是一把雙面刃的歸納偏好。它正是為什麼提早停止有效(你在高頻雜訊被擬合之前就停手),也是為什麼網路天生是平滑的內插器、能泛化。但它也是為什麼純 MLP 難以表示尖銳、高頻的目標——在神經渲染等領域的解法,是顯式注入高頻(傅立葉特徵、位置編碼),好讓譜偏差有東西可抓。