預訓練
用於 LLM 的 AdamW(AdamW for LLMs)
AdamW 是幾乎每個大型語言模型背後的主力優化器。樸素的梯度下降會讓每個權重都跨出同樣大小的步;Adam 則給每個權重各自的自適應步長,依梯度均值與變異數的滑動估計來縮放。梯度小而吵雜的參數會得到較大的有效步長,梯度大的參數則被收住——這讓訓練在 Transformer 內部差異極大的各種尺度上都穩定得多。
那個 W 標記了相對於樸素 Adam 的關鍵修正:權重衰減從梯度更新中解耦出來,改成一個獨立、溫和地把每個權重往零拉的力。在原本的 Adam 裡,把權重衰減硬塞進梯度,會與逐參數縮放產生不良交互、削弱正則化;解耦則乾淨地把它救了回來。對巨型模型而言這很重要,有助於讓權重維持良好條件並改善泛化。
AdamW 的代價是記憶體:它為每個參數多存兩個值(滑動均值與變異數),所以優化器狀態可達模型本身的兩倍大。這份額外開銷,正是大規模訓練要倚賴「分片優化器狀態」這類省記憶體技巧的一大原因。
又称
另见