預訓練
學習率預熱與衰減(learning-rate warmup and decay)
學習率控制優化器在每次更新時跨出多大的一步。LLM 訓練不會把它固定住,而是讓它隨時間變化。預熱讓學習率從接近零開始,在最初幾千步內逐步爬升;衰減接著在訓練的其餘部分把它慢慢降回來。整幅圖像就是先溫和地爬到一個峰值,再經歷一段長長的下坡。
兩個階段各有其價值。剛初始化的模型梯度混亂、條件很差,早期一大步就可能讓損失發散——預熱會緩緩切入,等優化器的滑動統計量穩定下來。訓練後期、接近一個好解時,大步會衝過頭、來回彈跳;把學習率衰減下去(常沿著餘弦曲線降到一個很小的底值)能讓模型微調進一個更尖銳、損失更低的區域。
排程的形狀是個實實在在的超參數:峰值學習率、預熱長度、最終值全都有影響,而且會與批次大小及模型寬度相互牽動。沒調好的排程,是預訓練停滯或不穩定最常見的原因之一。
又稱
另見