階層式強化學習與選項
選項策略與終止(option policy and termination)
每個選項都帶著兩個零件,決定它如何行動、又何時停下。選項策略是「做什麼」:在選項作用期間,它告訴智能體在每個狀態下該採取哪個原始動作,像個只會做一件事的小小專才控制器——開一扇門、穿過一個房間、把船靠岸。終止函數是「何時收手」:它在每個狀態下給出選項宣告自己完成、把控制權交回上層的機率。
這兩者的互動非常關鍵。終止觸發得太急,會把行為剁成無用的碎片,抽象的好處就沒了;幾乎不觸發,則讓選項僵硬,無法對意外作出反應。箇中藝術在於:讓選項的策略可靠地達成它的目的,而它的終止恰好在目的達成的那一刻觸發——在門口、在房間邊緣、在靠岸時。
在經典選項裡,這兩個零件是固定或手工設計的,但現代方法會去學它們。例如選項–評論家架構就把策略與終止都當成可微函數,用梯度去訓練,這正是選項能被「發現」而非「指定」的方式。
\beta_o(s)\in[0,1],\qquad a\sim\pi_o(\cdot\mid s)
終止 β 給出在狀態 s 停下的機率;選項策略 π_o 在執行期間挑選動作。
又称
另见