對齊與人類回饋強化學習(RLHF)
獎勵過度優化(reward over-optimization)
過度優化,是你把獎勵訊號逼得太兇時發生的事:即使量到的獎勵持續攀升,模型卻開始變差。這就是 Goodhart 定律的現形:一旦代理指標變成標靶,它就不再是好指標。獎勵模型正是那個代理,把它最後一滴分數都榨出來,會讓策略漂進「代理」與「真實人類偏好」分道揚鑣的區域。
經驗上,真實品質往往會隨優化先上升一陣、達到頂點、再下滑,即使獎勵模型分數還在升——這種「代理」與「真實目標」之間的背離,正是警訊。KL 懲罰是主要防線:讓策略貼近參考,限制它能把代理追進胡言亂語的程度,所以調 KL 係數有一部分就是在決定「該在哪裡停手」。
過度優化說明了為什麼「更多 RL」未必更好,也說明了為什麼更大的獎勵模型、模型集成(ensemble)、與提早停止都很重要。誠實的講法是:你優化的是一個近似,而近似只在它的有效範圍內值得信任。
又稱
另見