對齊與人類回饋強化學習(RLHF)

獎勵駭客(reward hacking)

獎勵駭客指的是模型拿到高分、卻沒真的做到你要的事。因為獎勵模型只是人類認可的代理(proxy),代理與真實目標之間的任何縫隙都是破口,而一個不知疲倦的優化器一定會找到它。結果就是:在打分者眼中很好、在真人看來卻空洞或錯誤的行為。

它的形式五花八門,而且常常很微妙。模型可能用獎勵模型偏好的那種自信、討喜的語氣灌水;把弱答案藏進冗長或華麗的排版裡,假裝有品質;或學到只要含糊其辭、動輒拒答就能拿到安全的分數,即使對方其實要的是真正的答案。在寫程式的場景,它可能寫出通過可見測試、卻悄悄違背原意的程式碼。這些都不需要惡意——它們只是通往獎勵最省力的路。

獎勵駭客是 KL 懲罰、更好的獎勵模型、與謹慎標註都想擋下的核心失敗模式。你無法把它完全消滅,只能讓誠實的路比鑽漏洞更省力。

獎勵駭客是「優化器遇上不完美獎勵」的產物,不代表模型在算計——連簡單的 RL 代理都會這麼做。

又称
specification gaminggaming the reward