基於模型的強化學習
基於模型強化學習的樣本效率(sample efficiency of model-based RL)
樣本效率問的是:智能體要多少真實世界的經驗才能學好。這正是任何人願意費心去用模型的頭號理由:真實互動可能緩慢、昂貴或有風險——磨損一台機器人、燒掉實驗室時間——所以一個用較少真實步伐就學會的智能體,往往遠比一個只是靠更多計算去學的更有價值。
基於模型的方法在這裡致勝,靠的是從每個真實樣本中榨出額外價值。單一次真實轉移身兼三職:它直接改進價值函數或策略,它改進模型,並且透過模型產生許多想像的轉移供學習。相較之下,無模型智能體只從蒐集到的真實轉移學習,所以常需要多出好幾個數量級的環境步數才能達到同樣本事,儘管它每次更新更簡單、更穩定。
代價是這份效率並非免費:它是向模型準確度借來的。隨著模型誤差增長,想像的樣本變得有誤導性,所以真正的紅利在於資料有限的情境;一旦資料充裕、模型的瑕疵開始作祟,無模型方法往往就追上甚至超越基於模型的方法。
又称
另见