基於模型的強化學習

背景規劃與決策時規劃(background vs decision-time planning)

模型能在兩個時刻幫上你,而這兩者感覺很不一樣。背景規劃發生在智能體的餘暇,遠離任何特定決策:它用模型不斷改進一個價值函數或策略,好讓真正的情境來臨時,答案早已內建好了。決策時規劃則發生在你非行動不可的當下:面對眼前這個確切狀態,你啟動模型,就地搜尋此時此地最好的一步。

Dyna 是背景規劃的原型——在真實步伐之間,它重放模型產生的轉移來打磨它的 Q 值,而到了行動時刻只需快速查一下策略。蒙地卡羅樹搜尋與 MPC 則是決策時規劃的原型——它們事前幾乎什麼都不做,卻在抉擇當下狠狠運算,為眼前的狀態建一個全新的局部前瞻。許多強大的智能體兩者兼用:一個習得的策略給出好的預設,再由決策時搜尋將其磨利。

這個取捨在於你何時付出計算。背景規劃讓行動便宜、反應即時,但內建的是策略當初泛化出的結果;決策時規劃能精確地因應當前狀態與不斷變化的模型,代價是每走一步之前都得花時間思考。

又称
background planning vs decision-time planning