微調與適配
指令微調(instruction tuning)
原始的基礎模型是個出色的自動補完:你問它一個問題,它可能就接著生出更多問題,因為訓練文字常常就是那樣。指令微調修正了這個錯位——它用大量寫成「指令加上完成內容」的範例來訓練,讓模型學會:指令是要被執行的請求,而不是要被續寫的文字。
它是監督式微調的一種特定形式,資料集橫跨各式各樣的任務——摘要、翻譯、分類、解釋——每一筆都寫成自然語言的指令。藉由在數千種任務類型上做泛化,模型學會了去遵循它從未見過的指令,這種能力常稱為零樣本泛化(zero-shot generalisation)。模型之所以讓人覺得「聽懂了你在問什麼」,很大一部分就來自這裡。
另見