從人類回饋學習——RLHF 與獎勵建模
獎勵模型(reward model)
想像一場烘焙比賽的評審,她跟主廚一起品嚐過上千個蛋糕,學會了預測主廚的評語。她自己不會烤蛋糕,但拿到任何一個新蛋糕,她都能打出一個分數,而且通常和主廚會說的一致。獎勵模型在 RLHF 裡扮演的正是這個角色:它是一個獨立的模型,唯一的工作就是看一個答案、輸出一個數字(獎勵),估計人類會有多喜歡它。
它是從人類偏好資料訓練出來的。我們給人看一個提示加上兩個候選答案,請他挑出比較好的那個;接著訓練獎勵模型,使人類偏好的那個答案得到比被拒絕的答案更高的分數(把成對比較轉成分數的數學就是 Bradley-Terry 模型)。訓練完成後,獎勵模型能自動替全新的答案打分,遠比每次都問人更快、更便宜,這正是強化學習步驟得以可行的關鍵:策略模型可以被打分數百萬次。
必須誠實點出的關鍵是:獎勵模型是人類偏好的「學習出來的代理」,而不是人類偏好本身。它是在有限的比較資料上訓練的,必然有盲點;只要把策略推得夠用力去最大化它的分數,策略就會找到一些「騙過獎勵模型卻並非真的更好」的答案,這個過程叫做獎勵過度優化,正是古德哈特定律的一個實例。這也是為什麼 RLHF 系統會搭配 KL 散度懲罰,並常常在策略改變時重新更新獎勵模型。
對於「這顆痣危險嗎?」的兩個回覆,獎勵模型可能把謹慎的「我無法診斷,請就醫」打 0.8 分,把自信卻錯誤的「看起來沒事!」打 0.2 分,因為評分者偏好謹慎的那個。
獎勵模型把大量人類比較壓縮成一個可自動產生的分數。
獎勵模型是代理,不是真值。對它優化得太用力,會讓「代理」與「真實人類偏好」分道揚鑣,因此獎勵模型給的高分,並不等於真正更好的答案。
又称
另见