對齊與人類回饋強化學習(RLHF)
大型語言模型對齊(LLM alignment)
想像一位才華洋溢的新進員工,會寫作、會寫程式、會推理,卻把每一句指示都照字面死板地執行,完全抓不到你真正的意思。對齊(alignment)就是在縮小這個落差:形塑模型的行為,使它追隨人類的意圖與價值,而不只是預測看起來合理的文字。預訓練後的模型懂得很多,卻沒有自己的目標;對齊賦予它一個目標——對眼前這個人真正有用且值得信任。
實務上,對齊是一層一層堆出來的。預訓練提供原始能力,指令微調教模型去「遵循」請求而非只是「接續」文字,而像 RLHF 這類基於偏好的方法,則用人類對「哪個回覆比較好」的判斷來細修語氣、有用性與安全性。目標是即使遇到沒人寫過規則的提示,模型仍維持有用、誠實、無害。
對齊並不是一個固定不變的標靶。不同的人與文化看重的事情不同,而模型可能在你測過的案例上看起來完美對齊,卻在沒見過的新情況下表現失常。因此最好把對齊當成持續的量測與修正,而不是打勾一次就忘掉的工作。
對齊塑造的是行為,而非底層知識——模型可以被對齊成「拒絕」某個它其實完全知道怎麼完成的請求。
又稱
另見