基於模型的強化學習
基於模型的強化學習(model-based reinforcement learning)
想像一位棋手在動手之前,先在腦中把接下來幾步走過一遍。基於模型的強化學習(model-based reinforcement learning)給智能體同樣一個內在的沙盒。它不只是學一個把情境對應到動作的反射,而是學一個關於世界如何回應的模型——下一個狀態大概是什麼、會帶來多少獎勵——再用這個模型在行動之前先想清楚。
具體來說,智能體從經驗中擬合一個逼近環境轉移與獎勵動態的函數。有了這個模型,它就能做到無模型方法做不到的事:產生想像的經驗並做規劃,既可以模擬許多可能的未來、挑出最好的第一步,也可以用便宜的合成軌跡來訓練策略。由於每一次真實互動同時也在教這個模型,每個樣本都被反覆利用很多次。
它的賣點是驚人的樣本效率,當真實資料取得緩慢或昂貴時(例如在實體機器人上)這格外重要。代價是有瑕疵的模型會把規劃帶歪,因此基於模型的強化學習的核心功夫,就是學出在關鍵處夠準的模型,並對它哪裡不準保持誠實。
基於模型與無模型並非對立;許多強大的系統兩者兼用——用模型來想像,同時仍以真實回報為一切的依歸。
又稱
另見