基於模型的強化學習
PETS(機率集成與軌跡抽樣,probabilistic ensembles with trajectory sampling)
PETS 對「我怎樣用一個深度模型做規劃,又不被它騙」這個問題,給出了一個乾淨而有影響力的答案。它的訣竅是不訓練單一個動態網路,而是訓練一小群機率性的集成網路,並把它們之間的分歧當成懷疑的量度。集成成員意見一致之處,模型可信;它們彼此分歧之處,規劃器就知道自己如履薄冰。
每個網路對下一個狀態輸出一個高斯分布,捕捉偶然雜訊;而幾個網路之間的散布,則捕捉因資料有限而來的認知不確定性。為了評估一個候選動作序列,PETS 抽樣許多條軌跡,每一步都把它推進到隨機選中的某個集成成員裡,使模型的不確定性被摺進預測回報中。接著一個基於抽樣的 MPC 控制器,藉由最佳化這些「考慮不確定性」的預測來選擇動作,每一步重新規劃。
PETS 證明了:謹慎地處理不確定性,能讓基於模型的智能體在連續控制基準上,用少得多的樣本就達到無模型方法的漸近表現。它的限制在於決策當下的計算負擔——許多模型、許多抽樣軌跡、每一步都要重新最佳化。
又稱
另見