基於模型的強化學習
潛在動態模型(latent dynamics model)
當觀測龐大又雜亂——比方一串相機畫面——逐像素地預測下一張原始影像既浪費又脆弱。潛在動態模型(latent dynamics model)繞過這點:先把每個觀測壓縮成一個由關鍵特徵組成的小向量,也就是潛在狀態,再在這個精簡空間裡(而非原始像素裡)預測未來。
它由一個把觀測映到潛在狀態的編碼器,以及一個轉移函數構成——後者在給定當前潛在狀態與動作時,預測下一個潛在狀態與獎勵,兩者一起學習。規劃與策略學習於是完全在這些小向量上進行,這便宜得多,也逼著模型只保留對控制重要的東西。旁邊可能還訓練一個解碼器,好讓潛在狀態必須保留足夠資訊去重建所見。
回報是智能體能很快想像出成千上萬個未來,因為每一步只是一次微小的向量更新,而不是一整張影像的預測。風險則是學到的特徵可能丟掉了任務暗中需要的東西,或者以難以檢查的方式漂移,因為這個空間並非人類可讀。
z_t = \text{enc}_\theta(o_t),\quad \hat{z}_{t+1},\hat{r}_t = g_\theta(z_t,a_t)
把觀測編碼成潛在狀態,再在潛在空間中預測下一個潛在狀態與獎勵。
又称
另见