基於人類回饋的強化學習

獎勵模型(reward model,由偏好訓練的)

人類無法手動標註強化學習智能體將產生的數百萬個例子,但你可以蒐集區區幾千筆比較,再學著去模仿那位人類評審。獎勵模型正是一個被訓練來做這件事的網路:讀進一個候選行為,輸出單一數字——大致是人會多喜歡它。一旦訓練好,它就為智能體源源不絕產生的新行為評分,頂替那位已經不在房裡的人類。

獎勵模型通常沿用策略的架構——對語言模型來說,就是同一個 transformer——再裝上一個純量輸出頭。它在一對對「被偏好/被拒絕」的輸出上訓練:損失函數獎勵它替被選中的項目給出較高分數,做法通常是透過 Bradley-Terry 對數似然。結果是一個可微、可查詢的獎勵場 r_φ,強化學習最佳化器愛呼叫多少次就呼叫多少次,而這正是下一階段所需要的。

獎勵模型既是 RLHF 的樞紐,也是它的弱點。它的好壞,頂多和它看過的比較一樣好;一旦離開那些資料的分布,它就變得過度自信;而策略會孜孜不倦地去找它出錯的地方。最後那種傾向——最佳化器被獎勵模型的誤差吸引過去——正是被稱為獎勵模型過度最佳化的核心危險。

\mathcal{L}(\phi)=-\mathbb{E}_{(x,y_w,y_l)}\big[\log\sigma\big(r_\phi(x,y_w)-r_\phi(x,y_l)\big)\big]

訓練獎勵模型,讓被偏好的輸出分數高於被拒絕的那個。

又称
preference reward model