基於模型的強化學習

世界模型(world models)

世界模型(world models)是智能體對整個環境一份精簡而具生成力的想像——不只是單步的物理,而是一個豐富到能夢出整段情節的模擬器。最鮮明的版本來自像素這類高維輸入:智能體學會把所見壓縮成一個小小的內部編碼,再學會這個編碼隨時間如何演變,於是它能在自己腦中把未來的影片往前播放。

這樣的模型通常有兩個部分。表徵模型把原始觀測編碼成一個低維的潛在狀態,轉移模型則預測在給定動作下這個潛在狀態如何改變,並搭配一個預測獎勵的輸出頭。一旦訓練好,世界模型就成了一個快速的私有模擬器:智能體能產生海量的想像經驗,幾乎完全在其中學出一套策略,只在需要讓模型保持誠實時才碰一下真實環境。

世界模型之所以重要,是因為真實互動才是稀缺資源——一個習得的模擬器,能把涓滴般的真實資料變成滔滔的練習量。危險在於,智能體可能對自己的夢過擬合,鑽想像世界裡的漏洞,而那些漏洞在現實中根本得不到回報。

「世界模型」與「習得的動態模型」概念重疊,但通常特指對高維觀測的生成式模型,常透過一個潛在狀態來建構。

又称
learned simulatorgenerative environment model