從人類回饋學習——RLHF 與獎勵建模
偏好學習(preference learning)
假設我請你替一首歌打 1 到 10 分。你的分數會隨心情飄移,而且你的 7 分可能等於我的 5 分。但如果我放兩首歌、問你比較喜歡哪一首,你的回答就穩定得多、也容易得多。偏好學習的核心想法,就是用這種相對比較(A 比 B 好)來教系統,而不是用絕對分數,因為人類「比較」遠比「打分」可靠。
具體來說,你蒐集一大堆比較,每一筆都是一個提示加上一個勝出答案與一個落敗答案,然後擬合一個模型,替每個答案指派一個隱藏分數,使勝者的分數傾向高於敗者。在 RLHF 裡,這個擬合出來的評分器就是獎勵模型,而把「A 勝過 B」轉成數值分數的標準作法就是 Bradley-Terry 模型。同樣的想法也驅動了不需要獎勵模型的方法,例如直接偏好優化(DPO),它直接從比較配對中學習。
偏好學習對安全很重要,因為它是我們傳達那些模糊人類願望(要有用、不要無禮、不要幫忙造武器)的方式,而這些願望我們無法寫成明確規則。但它有一個必須誠實面對的警告:一份偏好資料集記錄的是「誰的偏好、在什麼指示下蒐集的」。標註者之間的分歧、文化偏見,以及偏好較長或較自信答案這類怪癖,都會流進學到的目標裡,所以「人們偏好了什麼」並不自動等於「什麼是正確或良善的」。
與其請評分者替一篇文章打 0 到 100 分(雜訊很大),我們改成成對地展示文章、問「哪一篇比較清楚?」;數以千計這樣的選擇,就能讓我們推斷出一致的品質排序。
比較比絕對評分更可靠,這正是偏好學習採用比較的原因。
一份偏好資料集會把「誰的偏好、用什麼指示產生的」一併烤進去;偏好較長或較自信答案這類偏誤,會成為模型所優化目標的一部分。
又称
另见