強化學習理論
基於模型的策略最佳化(model-based policy optimization, MBPO)
基於模型的策略最佳化會學習一個「世界如何回應」的模型,然後在那個想像的模擬器中練習,而不只依賴真實經驗。關鍵紀律是:只在短的想像式展開(rollout)中信任模型,因為模擬得越遠,動態誤差就越會累積放大。
它訓練一組機率式動態模型的集成(ensemble),同時刻畫環境本身的雜訊,以及模型對未曾見過區域的自身不確定性。它從重播緩衝區取出的真實狀態出發,分岔出許多短展開,並用如柔性演員-評論家(SAC)這類離策略演員-評論家,在真實與模型生成轉移的混合上訓練。短視野加集成的設計帶來單調改善的界:只要模型誤差與展開長度夠小,在模型中最佳化就能改善真實策略。
短展開把模型偏誤控制在界內,集成則讓策略不易去鑽單一模型的怪癖。其結果是樣本效率明顯優於純無模型學習。
致勝關鍵不是完美的模型,而是短而分岔的展開:從真實狀態走幾步想像,能放大資料卻不放大累積誤差。
又称
另见