階層式強化學習與選項

選項內學習(intra-option learning)

學一個選項價值最天真的做法,是把它從頭跑到尾、看總獎勵、然後才更新——每完成一個選項才得一課,慢得令人難受。選項內學習是更聰明的替代:它從選項採取的每一個原始步驟去更新,而不只在結尾。時鐘的每一次滴答都成了學習訊號,於是一個跑五十步的長選項,給你的是五十次更新,而非一次。

這個技巧建立在一個一致性的想法上。在某個狀態下,許多選項可能對同一個原始動作有共識,而某選項作用時所採的一步,也是「任何其他會採同一步的選項」的證據。於是你可以用同一筆轉移,離策略地一次更新它們全部。這讓資料豐富得多,甚至能讓你學到智能體當下並未執行的選項。

實務上的效果,是階層內部的功勞分配快得多、樣本效率也好得多,因為沒有任何經驗被浪費在等選項終止上。它正是「時間差分學習勝過蒙地卡羅」那股直覺在選項層級上的對應:從每一步學,而不只從已完成的回合學。

又称
intra-option Q-learning