基於模型的強化學習

習得的動態模型(learned dynamics model)

習得的動態模型(learned dynamics model)是智能體對自身世界「物理規則」的最佳猜測,由資料學成而非外界給定。告訴它你在哪裡、做了什麼,它就預測你會落到哪裡、拿到多少獎勵。它是每一種基於模型方法的引擎:若沒有一個能說「接下來會發生什麼」的東西,就什麼都規劃不了、想像不出。

實務上它是一個函數——通常是神經網路——用蒐集到的轉移資料訓練,從當前狀態與動作預測下一個狀態與獎勵。訓練就是普通的監督式學習:把模型的預測和實際發生的結果之間的落差降到最小。模型可以是確定性的(給出單一個下一狀態),也可以是機率性的(給出下一狀態的分布),而且它可以在原始觀測空間預測,也可以在壓縮過的潛在空間預測。

殘酷的事實是,動態模型永遠只是個近似:在它見過的資料附近準確,離得遠就不可靠。而規劃偏偏傾向往那些不可靠的區域鑽,所以一個好模型還必須會表達自身的不確定性,而不是自信滿滿地胡謅。

\hat{s}_{t+1},\hat{r}_t = f_\theta(s_t,a_t),\quad \min_\theta \sum_t \big\| f_\theta(s_t,a_t)-(s_{t+1},r_t)\big\|^2

動態模型預測下一狀態與獎勵;訓練的目標是把對真實轉移的預測誤差降到最小。

又稱
transition modeldynamics modelworld model (predictor)