生成式AI與大型語言模型

指令微調(instruction tuning)

/ in-STRUK-shun TOO-ning /

指令微調,是教模型去「做你要求的事」、而非僅僅「續寫你的文字」的那一步訓練。一個未經雕琢的預訓練模型是自動補全的高手:你打「寫一首關於大海的詩」,它可能樂呵呵地回你「也寫一首關於群山的詩」,因為那是一句說得通的下文。指令微調糾正了這一點——它給模型看上千個「請求,隨後是一段好回答」格式的例子,直到模型學會:請求是用來「滿足」的,而不是用來「重複」的。

機理上,它是一種微調,在一份涵蓋眾多任務類型的「指令—答案」配對資料集上進行——概括這個、翻譯那個、解釋這個概念、修這段程式碼。模型學會了一種通用習慣:把使用者的話當成命令來對待。僅這一步,就在很大程度上把幾年前那些笨重的文字預測器,變成了人們如今天天與之閒聊的得力助手。

不過要把它的局限說清楚。指令微調讓模型「願意且能夠」聽從指令;它並不讓模型「正確」。一個指令微調得很好的模型,會信心十足地順著一個請求一路走向錯誤答案,也可能被誘導去執行有害的指令。可靠與安全,還需更進一步的工夫——通常是在其上疊加像RLHF這樣的人類反饋方法。

之前:當被提示「列舉迴紋針的三種用途」時,未經雕琢的模型寫出「列舉釘書機的三種用途」——純粹是聽起來說得通的文字。經過指令微調後,同樣的提示會給出一份真正的、迴紋針用途的編號清單。

從「續寫我的文字」到「做我要求的事」的轉變。

指令微調(也叫監督微調,SFT)通常是「對齊」的第一階段,其後才是RLHF或DPO之類的偏好方法。SFT教給模型「樂於助人」的形態;偏好階段則進一步打磨:在幾個說得通的答案裡,人們究竟更喜歡哪一個。

又稱
instruction fine-tuningsupervised fine-tuningSFT指令微调指令微調监督微调