對齊與人類回饋強化學習(RLHF)

偏好資料標註(preference data annotation)

偏好資料標註是 RLHF 底下的人類工夫:真人標註者看著兩則回覆、判定哪個比較好的那道流程。聽起來簡單,但模型最終性格的很大一部分,正是在這裡悄悄被定下來的。標註者依循準則作業,這些準則界定該看重什麼——正確性、有用性、安全性、語氣——以及它們衝突時如何權衡。

好的標註之所以難,是因為人的因素。標註者會累,會退回去看表面線索,如長度、自信、排版;長答案就算灌水也顯得周全;順著人意的答案就算錯了也讓人比較舒服。不同文化與個人對邊界案例看法不一。專案會用清楚的評分準則、校準範例、標註者間一致性檢核,有時還一筆比較配多名標註者來對抗這些問題。

因為獎勵模型只能學到標註教它的東西,這裡每一個系統性偏誤——獎勵自信的錯誤、過度獎勵拒答、偏好冗長——都會變成上線模型繼承的偏誤。從很實在的意義上說,標註準則就是模型價值觀的初稿。

又稱
human labellingrating guidelines