從人類回饋學習——RLHF 與獎勵建模
成對偏好比較(pairwise preference comparison)
在驗光時,你不會試著替自己的視力打個十分制的分數;醫生會在兩片鏡片之間切換,問你「一號,還是二號?」。把這個簡單選擇重複很多次,就能精準定出你的度數。成對偏好比較正是把這套方法套用到 AI 答案上:給一個人看同一個提示的兩個候選回覆,問哪個比較好。這就是餵給獎勵模型與 RLHF 的原始資料。
流程很直接。對於某個提示,模型產生兩個(有時更多)答案;人類標註者讀完兩者、標出勝者,並可選擇性地記下偏好有多強。把這些(提示、勝出、落敗)三元組蒐集到數以千計,就成了訓練集:獎勵模型或直接偏好方法會學著讓勝出答案的分數高過落敗答案。之所以用成對比較而非 1 到 10 的分數,是因為二選一的「這個比較好」更快、雜訊更小,而且在不同標註者之間更一致。
必須誠實面對的警告是:這些比較的好壞,完全取決於背後的人與流程。標註者會分歧、會疲倦,也會抓住表面線索,最有名的就是即使較長或較自信的答案並沒有真的更好,他們也傾向打更高分。這些偏誤會原封不動地傳進獎勵模型、再傳進訓練好的策略,正是諂媚與「答案灌水變長」等問題的根源之一。詳盡的標註準則、每對配多名標註者,以及品質抽查都有幫助,但永遠無法完全消除雜訊。
提示:「向小孩解釋光合作用。」答案 A 是溫暖的兩句比喻;答案 B 是一整段塞滿術語的文字。標註者點選 A,於是產生一筆(提示、勝出=A、落敗=B)的訓練配對。
一次「哪個比較好?」的點選,就成為一筆標註好的偏好配對。
要留意長度與自信偏誤:評分者常不論對錯地挑較長或較斷然的答案,而這個偏誤正是獎勵模型接著會去追逐的東西。
又稱
另見