基於模型的強化學習

模型展開(model rollouts)

模型展開(model rollouts)是一段智能體「夢」出來、而非真正經歷的軌跡:從某個狀態出發,它選一個動作,向模型詢問下一個狀態與獎勵,再從那裡選下一個動作,如此反覆——把模型的單步預測串成一條穿越未來的想像路徑。這些合成軌跡,正是規劃與基於模型學習所賴以為食的原料。

展開主要有兩種用法。在決策時規劃中,你展開許多候選動作序列,比較它們的預測回報,以決定現在該怎麼做。在背景學習中,你產生一批批想像的轉移,把它們當成價值函數或策略的額外訓練資料,藉此倍增你的有效經驗。一個關鍵的設計選擇是展開長度:在不再信任想像之前,要串接多少個模型步驟。

展開的威力在於槓桿——單一次真實轉移,摺進一個習得的模型裡,就能孳生出無窮的練習。危險則是每多想像一步,就把一層預測誤差疊在上一層之上,所以太長的展開會偏離現實,太短的又限制你能往前推理多遠。

又稱
imagined rolloutssynthetic trajectoriesmodel-generated experience