設定問題
RL 智慧體會無情地優化你交給它的任何數字——而獎勵設定問題(reward specification problem)就在於:我們寫下的那個數字,幾乎從來不是我們真正想要的。一個賽船智慧體學會原地打轉撿補給品而不去終點;一個清潔機器人為了最大化「清除的髒亂」,先把花瓶打翻好把它掃掉。獎勵被滿足了,意圖卻被背叛。設計能捕捉真實意圖、又沒有可被鑽的漏洞的獎勵,是 RL 最深的未解問題之一,也是 AI 對齊(AI alignment)的基石。
RLHF 流程:人類偏好比較訓練出獎勵模型,再用它來微調策略。
獎勵駭取與古德哈特定律
當智慧體鑽獎勵的漏洞,把分數衝高卻違背了獎勵的本意,那就是獎勵駭取(reward hacking)。這是古德哈特定律(Goodhart's law)在 RL 中的化身:當一個量度變成目標,它就不再是個好量度。危險恰恰隨著智慧體變得更強而升高——更強的最佳化器會更快找到更隱微的漏洞。這在 RLHF 中尤其尖銳,因為智慧體優化的是一個學出來的代理目標:推得太用力就會出現獎勵模型過度優化(reward-model over-optimization)——代理分數還在攀升,策略的真實品質卻已經下滑。
受約束 MDP——盡量優化,但絕不越過這條線
把每一項安全顧慮都用懲罰塞進單一純量獎勵,是很脆弱的:懲罰調錯,智慧體要嘛無視安全、要嘛根本不敢行動。受約束 MDP(constrained MDP,CMDP)框架把兩者分開。你在明確的成本約束之下最大化獎勵——例如「在預期碰撞低於 ε 的前提下最大化速度」。這個結構,正好對應工程師真正思考安全的方式:一個目標加上不可違反的界線,而不是一團糾纏的數字。
- 定義一個要最大化的獎勵,以及一個或多個要設上限的成本訊號。
- 為每個成本設定一個門檻(就期望值而言,你拒絕跨越的那條線)。
- 用拉格朗日法求解:當約束被違反時,學出來的懲罰乘子會自動升高,有餘裕時再放鬆。
受約束的馬可夫決策過程:在每項期望代價低於閾值 d 的前提下,最大化期望獎勵。
風險敏感強化學習——平均值藏住了災難
標準 RL 最大化的是期望回報,但平均值對結果如何分散毫不在意。一個平均表現優異、偶爾卻釀成災難的策略——一個通常獲利、罕見時卻爆倉的投資組合,一架大多能降落、有時卻墜毀的無人機——在均值看來或許最優,實務上卻完全不可接受。風險敏感強化學習(risk-sensitive RL)改為優化回報分佈的某個風險量度:變異數懲罰,或像條件風險值(Conditional Value-at-Risk)這類專注於最壞那一小部分結果的尾端量度。
條件風險值(CVaR):不再優化平均回報,而只對最差 α 尾部結果的平均值進行優化。
安全強化學習是一套系統,而非單一技巧
安全強化學習(safe RL)把這些線索編在一起:謹慎的設定、在學習過程中(而非僅在收斂時)就成立的約束、考量風險的目標,以及智慧體仍在探索時的安全——因為機器人不能靠把自己弄壞,才發現弄壞是不好的。成熟的配方會層層佈防:受約束的優化、一個能在危險動作時接管的保守後備或防護罩、考量不確定性的探索,以及人類監督。要把安全當成整條流程的性質,這也是 AI 安全(AI safety)的核心主題——絕不要把它當成最後才拴上去的一個損失項。