深度學習理論
穩定性邊緣(edge of stability, EoS)
古典最佳化理論給出一條嚴格的速度限制:要讓梯度下降單調地降低損失,步長必須把曲率壓在「二除以學習率」以下。然而,用全批量梯度下降去訓練一個真實的網路,它做的恰恰是不聽話。曲率會一路爬升,直到剛好碰到那個門檻,然後最佳化器就停在邊緣上盤旋——損失逐步上下彈跳,長期下來卻穩定地往下漂。
這裡的「銳度」指的是損失海森(Hessian)矩陣的最大特徵值。兩個效應交織在一起:漸進銳化在訓練中把那個最大特徵值往上推,直到它撞上「二除以學習率」,此後動力學就進入穩定性邊緣區制——銳度大致卡在那個值,而損失非單調卻仍下降。這直接牴觸了古典的下降引理圖像:在那個圖像裡,超過門檻本應導致發散,而不是有效的訓練。
穩定性邊緣重新描繪了大步長梯度下降在神經網路上實際的行為,並把步長直接連到「最佳化器願意容忍多少曲率」——這提醒我們,從凸理論搬來的平滑最佳化直覺,在碰上深度學習時只能部分存活。
\lambda_{\max}(\nabla^2 L) \approx \frac{2}{\eta}
在穩定性邊緣,海森矩陣的最大特徵值(銳度)盤旋在 2/η 附近,其中 η 是學習率。
又稱
另見