基於模型的強化學習
模型預測控制(model predictive control,MPC)
模型預測控制(model predictive control,MPC)是一種「永不全盤承諾」的規劃。每一步,智能體用模型往未來看一小段距離,算出這個視窗內最佳的動作序列,卻只執行其中第一個動作,接著把其餘的丟掉,下一步再從頭重新規劃。它就是規劃—行動—再規劃,一遍又一遍。
這個反覆進行的最佳化是在有限視野上做的:最大化接下來 H 步預測獎勵的總和,可能再加上視野末端的一個估計價值,用以涵蓋更遠的未來。強化學習裡常見的一種做法是基於抽樣的 MPC:從模型抽出許多隨機動作序列,逐一評估,再把下一次的規劃往最好的那幾條靠攏——交叉熵法與隨機射擊(random shooting)都是常見變體。
不斷重新規劃正是 MPC 穩健的原因:因為每次只用第一個動作、而且每一步都從真實的當前狀態重新詢問模型,預測誤差在還沒累積之前就被修正掉了。代價則是每做一次決策,都得重新求解一個全新的最佳化問題。
a_{t:t+H-1}^* = \arg\max_{a_{t:t+H-1}} \; \mathbb{E}\!\left[\sum_{k=0}^{H-1}\gamma^k \hat{r}_{t+k}\right],\quad \text{execute } a_t^* \text{ only}
MPC 在模型下最佳化一段 H 步的動作序列,只執行第一個動作,然後重新規劃。
又称
另见