深度學習理論

平坦極小值與泛化(flat minima and generalization)

在許多能達到相同低訓練損失的權重設定之中,到了測試時並非一視同仁。一個持久的經驗規律是:坐落在損失寬廣平坦山谷裡的解,比卡在尖銳狹窄裂縫裡的解泛化得更好。直覺上,平坦的極小值是穩健的:對權重的小擾動——或訓練損失與真實損失之間那道無可避免的落差——幾乎不會移動損失,所以這個解很寬容。

平坦度通常以海森矩陣特徵值有多小、或在最壞情況的權重擾動下損失上升多少來衡量。有幾種理論把它連到泛化:最小描述長度與貝氏論證賦予平坦極小值較大的奧坎因子(它們在權重空間中佔據更大的體積),而 PAC-Bayes 界把擾動穩健性化為一個明確的項,用以控制泛化落差。這個觀點催生了主動尋求平坦度的訓練方法,最著名的是銳度感知最小化(SAM)與 entropy-SGD。

尖銳的提醒是:平坦度並非在重新參數化下不變。把一個 ReLU 網路的權重重新縮放,能在完全不改變函數的情況下,把一個尖銳的極小值變得看起來平坦,因此樸素的銳度是可以被鑽空子的。有意義的理論因此需要尺度感知或正規化後的平坦度度量。

銳度可以靠重新縮放權重來灌水或縮水、卻不改變函數——下結論前,尺度不變的度量是不可或缺的。

又稱
flat minima平坦極小值sharpness-aware