階層式強化學習與選項
選項框架(options framework)
選項是把智能體可以像呼叫副程式那樣呼叫的「技能」或「巨集行為」做最乾淨的形式化。想像一顆標著「走到門口」的按鈕:一按下去,內建的控制器就接手,依需要操縱身體多久就多久,抵達後再把控制權交回。由 Sutton、Precup 與 Singh 提出的選項框架,把這顆按鈕變成一個一等物件,讓智能體能在它與原始動作之間(或取而代之)做選擇。
嚴格地說,一個選項是個三元組:起始集合(你被允許啟動它的那些狀態)、內部策略(執行期間它採取哪些原始動作)、以及終止條件(在每個狀態下它結束的機率)。當頂層策略選了某個選項,該選項的策略就驅動智能體,直到終止觸發,再把控制權交回頂層。原始的單步動作不過是「永遠在一步後就終止」的特例。
巧妙之處在於:規劃與學習可以把選項當成一般動作來進行,於是底層問題就化成一個半馬可夫決策過程。這縮短了視野、讓技能能在任務間轉移,也在規劃者與其控制器之間給出乾淨的介面——這正是為什麼即使數十年後,選項仍是多數階層式強化學習的骨幹。
o=\langle\mathcal{I},\,\pi_o,\,\beta\rangle
一個選項由起始集合、內部策略與終止函數構成。
又稱
另見