基於人類回饋的強化學習

獎勵模型集成(reward model ensembles)

單一獎勵模型有盲點,而最佳化器會把它們一一獵出。一種防禦,是去問好幾個獎勵模型、而不只一個。用同樣的偏好、但不同的隨機種子或資料順序訓練一小批,它們在資料紮實處多半會一致、在資料不穩處則會分歧。它們的分歧,正是對「任何單一個都可能被騙」那些區域的內建警報。

你訓練一個集成,再把成員合起來——對它們的分數取平均,或更有用地,用它們的分歧(變異數)去懲罰策略。在模型一致之處,獎勵被信任、策略照常最佳化;在它們分歧之處,有效獎勵被打折,於是最佳化器被勸阻、不敢闖進那些不確定、易被駭的區域。這把集成的知識性不確定,轉成一股抵抗過度最佳化的保守壓力。

集成有幫助,但不是解藥。成員共用訓練資料與架構,所以也共用盲點,可能一起自信地錯;集成還把計算與記憶體成本翻倍。它是對抗獎勵駭客一種局部、實用的對沖,最好和 KL 懲罰與新鮮比較疊著用,而不是單獨倚賴它、彷彿分歧就能抓出每一個失靈。

又稱
ensemble of reward models