基於人類回饋的強化學習

偏好資料集蒐集(preference dataset collection)

獎勵模型的智慧,頂多和它學習的那些比較一樣高,所以大規模蒐集這些比較,就佔了 RLHF 一半的工夫——而且它遠比乍看更像一個人因與工程問題。你需要能涵蓋你真正在意情境的提示、要拿來比較的模型輸出、受過訓練的標註者去判斷它們,以及一套準則,好讓不同的人判得大致一致。

典型的循環會從真實使用或精選集裡抽提示,用目前的模型替每個提示產生兩個以上的候選回應,再交給標註者依評分準則挑出較好的那個。品質控制至關重要:評分者訓練、標註者間一致性檢查、黃金標準題,以及對不可靠標註者降權。資料會去重並切分,且常隨策略改進而更新,因為昨天的比較,已漂出智能體如今造訪的分布之外。

這條流程裡的每個偏差,都會變成模型裡的偏差。標註者的人口組成、疲勞、悄悄獎勵長度或自信的指示、以及提示的挑選方式,全都會在最終行為上留下指紋。把偏好資料蒐集好,重點不在於量大,而在於涵蓋面、一致性與誠實的準則——這些做錯了,再多的強化學習也救不回結果。

又称
preference data collection