JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

端到端學習選項:選項內學習與選項-評論家

別再手寫技能。用選項內學習與選項-評論家架構,直接從獎勵學會選項策略和它們的終止條件——並認識一直纏著它的失敗模式。

自舉的難題:選項從哪裡來?

手工設計的選項需要一個「早已了解任務結構」的人——而那正是我們本來希望智能體去發現的知識。階層式強化學習的宏大目標是只靠獎勵就學會整疊:高層策略「以及」選項策略「以及」它們的終止條件,全部同時學。有兩個想法讓這變得可行。

選項內學習:榨乾每一個轉移

一個天真的做法只在選項「結束時」才更新它的價值——白白浪費了執行途中收集到的豐富經驗。選項內學習(intra-option learning)解決了這點:每一個原始轉移都被用來更新「每一個其策略會採取同一動作的選項」,而不只是當前正在執行的那一個。

這是一種離策略(off-policy)的紅利:執行某項技能的同時,智能體悄悄地學到「所有與它一致的其他技能」,於是資料被共享而非各自為政。結果是樣本效率大幅提升——即使某個選項不是當下掌權的那一個,它也能進步。

選項-評論家架構

選項-評論家架構(Option-Critic architecture)是個里程碑式的成果,它「以梯度端到端地」學會選項,不需要子目標、不需要偽獎勵(pseudo-reward)、也不需要手工指定的終止。它把策略梯度定理延伸到選項設定,一次為兩個新物件推導出梯度。

Option-Critic 透過沿損失曲面下降的梯度,端到端地學習選項策略與終止條件——無需子目標或偽獎勵。

互動式梯度下降,沿損失曲面滾動至最小值。

  1. 選項內策略梯度(intra-option policy gradient)改進每個選項的行為方式,把它的動作推向更高的長期價值。
  2. 終止梯度(termination gradient)調整每個選項「何時」停下:當一個選項仍有優勢時就該繼續,當換別的選項會更好時就該終止。
  3. 一個評論家(critic)估計選項價值函數,提供驅動上述兩種梯度的優勢訊號——正是評論家在一般演員-評論家(actor-critic)架構中扮演的角色。
\nabla_{\theta} J \;=\; \mathbb{E}\!\left[\,\nabla_{\theta}\log \pi_{\omega,\theta}(a\mid s)\; Q_{U}(s,\omega,a)\right]

選項內策略梯度:每個選項的策略都會朝著其選項價值 Q_U 較高的動作進行調整。

把發現當成副產品——瓶頸與子目標

選項-評論家是「隱式地」發現結構:終止梯度自然會學著在有用的決策點附近結束選項,而這些點往往正是瓶頸狀態。一條互補、更「顯式」的研究路線則先做子目標發現——從軌跡中挖出許多成功路徑共享的、門口般的狀態,再為抵達每一個狀態各建一個選項。

瓶頸狀態就是許多軌跡都必須經過的樞紐——探索這個馬可夫鏈,找出選項自然傾向於終止的位置。

互動式馬可夫鏈,展示狀態與轉移機率,以及類似樞紐的瓶頸節點。

兩條路線都在回答同一個問題——「什麼值得成為一項技能?」——只是從相反方向出發:隱式發現讓獎勵去塑造選項,顯式發現則用圖結構為選項播種,再加以精煉。

失敗模式:選項崩塌

學到的選項有個惡名昭彰的病態。在缺乏「保持彼此相異」的壓力下,選項-評論家往往以兩種方式之一退化:要嘛某個選項獨佔整個任務(其他選項都閒置),要嘛每個選項幾乎立刻終止,於是階層悄悄塌回扁平的、原始動作層級的控制。兩者都讓終止機制變得毫無意義。