階層式強化學習與選項

半馬可夫選項(semi-Markov options)

在一般的馬可夫決策過程裡,每個決策恰好持續一個時間步。但一旦你的動作是選項,單一個高層決策就能持續可變、依狀態而定的步數——「走到門口」在小房間可能三步,在大房間可能三十步。一旦時長不再固定,高層所見的過程就不再是普通的 MDP,而是一個半馬可夫決策過程,其中決策之間的時間本身就是個隨機量。

好消息是強化學習的核心機制幾乎原封不動,你只需把流逝的時間算進去。選項層級的貝爾曼更新會帶上選項執行期間累積的折扣獎勵,並用 gamma 的「選項實際時長」次方、而非單一個 gamma,去折扣下個狀態的價值。加上這個調整後,價值迭代、Q 學習與規劃在選項上的運作,就和在原始動作上完全一樣。

這正是選項框架如此強大的形式理由:把延展的行為視為半馬可夫決策,你就得到一套在粗時間尺度上規劃的嚴謹算術,而不必放棄標準強化學習任何收斂保證。半馬可夫觀點,正是讓「選項即動作」不只是個經驗法則的關鍵。

Q(s,o)=\mathbb{E}\!\left[\,r_{t+1}+\cdots+\gamma^{k-1}r_{t+k}+\gamma^{k}\max_{o'}Q(s_{t+k},o')\,\right]

持續 k 步的選項,用 γ^k(而非 γ)折扣下一個價值。

又稱
SMDP over optionssemi-Markov decision process