前沿與開放問題

受限馬可夫決策過程(constrained MDP)

受限馬可夫決策過程(constrained MDP)是 RL 中安全性最乾淨的形式化歸宿。它保留了一般 MDP 的一切——狀態、動作、轉移、一個要最大化的獎勵——並加上一個或多個成本訊號,每個都帶有一份預算。智能體的工作從「單純最大化回報」變成「在把期望累積成本壓在限制之下的前提下最大化回報」,例如:在把期望碰撞次數壓在某門檻以下的同時,盡可能開快。

數學上它是一個受限優化,而標準工具是拉格朗日法:引入一個乘子,為每一單位的約束違反定價,再聯合地學習策略並調整這個乘子,使約束在最佳解處恰好被滿足。受限策略優化,以及行動者—評論家方法的拉格朗日變體,都在實務上求解它。與一個手工調的懲罰不同,這個乘子是被學出來的,因此這項取捨會自我校準,以真正滿足那份預算。

\max_{\pi}\ \mathbb{E}_{\pi}\!\Big[\textstyle\sum_{t}\gamma^{t} r_t\Big]\quad \text{s.t.}\quad \mathbb{E}_{\pi}\!\Big[\textstyle\sum_{t}\gamma^{t} c_t\Big]\le d

在把期望折扣成本壓在預算 d 以下的前提下,最大化折扣回報。

又稱
CMDP