強化學習理論

選項與階層式強化學習(options and hierarchical RL)

人會用「泡咖啡」這類子程序來規劃,而不是用一條條肌肉抽動。選項(options)賦予代理人同樣的能力:一個選項是時間上延展的動作,亦即一個子策略,外加它何時可啟動、何時該停止的規則。在選項而非基本動作的層次上規劃,能縮短決策者必須跨越推理的有效視野。

形式上,一個選項是三元組:啟動集合、選項內策略,以及給出每個狀態下停止機率的終止條件。以選項為動作的決策過程會成為半馬可夫決策過程(semi-MDP),其選項價值函數滿足一個帶可變時間步的貝爾曼方程。選項-評論家(option-critic)架構以梯度上升端到端地學習選項內策略與其終止函數,無須手工指定子任務。

階層有助於跨時間尺度的功勞分派(credit assignment),但也帶來自身的失效模式:選項可能退化成單一基本步,或學會永不終止,使階層塌回成扁平的強化學習。

學習而來的選項常會塌縮:通常需對終止加以正則化(給停止一個成本),才能避免它縮成單步動作或永不停止。

又稱
options frameworkHRL階層式強化學習