大規模訓練
持續預訓練(continued pretraining)
持續預訓練取一個已在廣泛語料上預訓練好的模型,以相同的自監督目標在新的分布上繼續訓練它——某個專門領域如程式碼、生醫或法律;一種新語言;或遠長於它原本所見的序列。它介於預訓練與微調之間:仍對大量無標註文本做下一個 token 預測,但是從已學得的權重出發、而非隨機權重,因此它調適的是模型的知識,而非安裝一項狹窄技能。
核心難處是穩定性與可塑性的取捨。在新資料上訓得太用力,模型會災難性遺忘,失去那耗費鉅資才取得的通用能力;訓得太輕柔,它又從未真正吸收新領域。實務上的槓桿是回放混合(把一部分原始分布摻回來)、重新暖機但幅度溫和的學習率,以及仔細的資料整理。專就上下文延伸而言,對長文件的持續預訓練會搭配位置編碼調整,如 RoPE 基頻縮放,使注意力能泛化到超出原始視窗的長度。
持續預訓練是通往專門化或更長上下文模型的經濟路徑——遠比從零預訓練便宜,對於深度領域偏移又遠比單純微調更有能力。它誠實的侷限是:它無法加入一項底層模型在規模上根本撐不起的全新能力;它重新分配並延伸既有能力,而非創造它。
持續預訓練與微調的差別在目標、不只在規模:前者保留對原始文本的自監督下一個 token 損失,微調則優化某個任務或偏好目標,因此兩者塑造模型的方式在本質上不同。
又稱
另見