對齊與人類回饋強化學習(RLHF)

人類偏好資料(human preference data)

人類偏好資料是 RLHF 的燃料。與其請人寫出理想答案(既慢又不一致),不如把同一個提示配上兩個不同的模型回覆,問一個比較簡單的問題:哪個比較好?大規模蒐集這些成對比較,便能在沒有人明寫規則的情況下,編碼大量關於「人覺得什麼有用、清楚、安全、誠實」的資訊。

每筆資料大致是一組三元組:一個提示、一個被選中的回覆、一個被拒絕的回覆。這些回覆可能來自不同模型、不同取樣設定或不同解碼溫度,所以資料集涵蓋了各種品質。接著訓練獎勵模型,讓被選中的回覆分數高於被拒絕的回覆,從許多這樣的比較中學出人類偏好的「形狀」。

這份資料的品質決定了下游一切的天花板。模糊的標註準則、趕工的標註者、或會獎勵「聽起來自信但其實錯誤」答案的標註者,都會把隱性偏誤悄悄烙進獎勵模型,而最終的策略也會一併繼承這些偏誤。

又稱
pairwise comparisonspreference pairs