基於模型的強化學習
Dreamer(潛在想像學習,learning by latent imagination)
Dreamer 把一個想法推到邏輯的盡頭:智能體幾乎可以完全在自己腦中學會怎麼行動。它先從真實經驗學出一個潛在世界模型,接著訓練策略時根本不碰真實環境,而是在那個潛在空間裡想像出的一長串未來上訓練——它學會在夢裡好好行動,而這份本事會遷移到現實。
世界模型把觀測編碼成潛在狀態,並預測它們的演變、獎勵與價值。為了改進行為,Dreamer 從抽樣的起始狀態把潛在模型往前展開許多步,產生想像的軌跡,再讓預測的長期回報沿著可微分的動態一路反向傳播,直接灌進策略——這是一個在夢上訓練的演員—評論家。真實互動只用來精修世界模型,使它在像素任務上展現出驚人的資料效率。
Dreamer 是一座里程碑,因為它證明了「純粹從想像中學習」能在困難的連續控制與 Atari 任務上追平甚至勝過無模型智能體,同時用的真實資料少得多。它的限制一如往常:夢只能和產生它的世界模型一樣可信。
又稱
另見