基於模型的強化學習
用模型做規劃(planning with a model)
規劃就是有了模型之後你會做的事:在跳之前先看清楚。你不是貿然做出一個動作再看結果,而是請模型在想像中把候選的行動方案演練一遍,依它們賺到的獎勵替這些未來打分,然後採取「最佳想像未來」所起始的那個動作。
在機制上,這把控制變成了在模型之上的搜尋或最佳化問題。你可以隨機抽樣許多動作序列、留下得分最高的一條,可以用最佳化器去精修序列,也可以用更聰明的前瞻長出一棵未來之樹。無論哪種方式,模型都負責提供預測的下一狀態與獎勵,讓你不必真的付出嘗試成本就能比較各種選項。
規劃的長處在於它能立刻對一個剛學到或剛改變的模型做出反應——不需要緩慢地重新訓練策略。它的短處是決策當下的計算量,以及對模型品質的完全依賴:在錯誤的模型裡規劃,你只會自信地選出一個錯誤的動作。
又称
另见