階層式強化學習與選項

巨集動作(macro-actions)

巨集動作是時間抽象最簡單的形式:一段固定、預先排好的原始動作序列,智能體把它當成單一單位來叫用。想想格鬥遊戲的連招——按一個鍵就依序放出「拳、拳、踢」,中間沒有任何決策。選了一個巨集,就等於承諾智能體把那串確切的清單跑到完,才輪到它再次選擇。

巨集與完整選項的分別,在於執行期間缺乏回饋。巨集是開迴路的:它不理會途經的任何狀態,只是重播它那段罐裝序列;而選項是閉迴路的,每個原始動作都會依當前狀態查詢它的內部策略來選。這讓巨集更簡單、定義與規劃成本更低,但也脆弱——一旦世界偏離了序列所假設的,巨集就無從適應。

當行為的片段真的很重複、環境又可預測到「盲目重播也行得通」時,巨集很有用:它縮短決策視野,能大幅加速搜尋與規劃。但當世界充滿不確定或會反應時,選項那份閉迴路的彈性就值回票價,而巨集最好被看成時間抽象光譜上最樸素的那一端。

又稱
macrosaction sequencesopen-loop options