微調與適配
持續預訓練(continued pretraining)
在你教模型於某個專業領域裡遵循指令之前,先讓它單純地大量讀一讀那個領域,會很有幫助。持續預訓練做的正是這件事:你拿一個已經訓練好的基礎模型,用相同的自監督「預測下一個詞元」目標繼續訓練它,只是改在一大堆領域文字上——法律見解、醫學文獻、一份程式碼庫,或一種新的語言。
和指令微調不同,這裡沒有精心整理的問答配對,只有原始的領域文件,以及原本那個預測下一個詞元的損失。這會吸收原始預訓練覆蓋不足的詞彙、慣例與事實。在領域流程裡它通常排在指令微調之前:先拓寬模型對該領域的知識,再去塑造它怎麼回應。要盯著學習率,並混入一些通用資料,否則你就是在自招災難性遺忘。
又称
另见