大型語言模型工程

監督式微調(SFT,supervised fine-tuning)

一個預訓練的基礎模型是個流暢的下一詞預測器,並沒有特別想遵循指令的傾向——你問它一個問題,它可能接著續寫更多問題。監督式微調,正是教它表現得像個助理的那一步。你蒐集一組精挑細選的輸入—輸出示範——一個提示,以及一個好幫手會給出的理想回應——並繼續訓練模型去重現那些回應,使它學會「樂於助人、遵循指令」這種行為的形狀。

在機制上,它與預訓練是同一個最大似然目標:最小化預測每個下一詞元的交叉熵,只不過現在是針對示範的完成部分。有兩個工程細節要緊。損失通常會被遮罩,只計入助理的詞元、不計入提示,使模型被評分的是它該生成什麼,而非抄寫輸入。而輸入會被包進帶有明確角色標記的對話模板裡,模型把它學成區隔使用者回合與自己回合的鷹架。

SFT 是後訓練第一階段的主力,也常是日後偏好方法所打磨的基礎。它的天花板由示範的品質與覆蓋面決定:模型完全模仿它被展示的東西,因此資料裡的缺口與偏誤會變成行為裡的缺口與偏誤,而純 SFT 難以表達「該避免什麼」——它只能表達「該做什麼」——這正是為什麼後面通常會接一個對齊階段。

把損失遮罩到只算完成部分並非可有可無的潤飾:若連提示加答案整段一起訓練,模型會浪費容量去學重生使用者輸入,常使指令遵循變差。

又稱
SFT監督式微調instruction tuning