強化學習理論
後繼特徵(successor features)
後繼特徵把「一個策略會帶你去哪裡」與「那些未來之處值多少」分開。它在某策略下,總結特徵的期望折扣未來佔有量,且與任何特定報酬無關。一旦握有它,代入新的報酬權重,幾乎能立即得到該報酬下的價值,這正是它在跨任務遷移上強大的原因。
假設報酬對某特徵向量是線性的,亦即特徵與權重向量的內積。某策略的後繼特徵就是沿其軌跡這些特徵的期望折扣總和,因此任何任務的動作價值,不過是後繼特徵與該任務權重向量的內積。廣義策略改善(generalized policy improvement)接著取一組策略後繼特徵所成的庫,對新任務就以它們的最大值貪婪行動,立刻產生一個好策略,無須從頭重學。
後繼特徵把 Dayan 的後繼表示(successor representation)從原始狀態推廣到學習而來的特徵。但有個前提:唯有報酬確實對所選特徵呈線性時,遷移才是精確的。
\psi^{\pi}(s,a)=\mathbb{E}_{\pi}\!\Big[\sum_{t\ge0}\gamma^{t}\,\phi(s_t,a_t)\ \Big|\ s,a\Big],\qquad Q^{\pi}(s,a)=\psi^{\pi}(s,a)^{\top} w
後繼特徵是折扣後的期望未來特徵;價值不過是它與任務報酬權重的內積。
後繼特徵把價值拆成「由動態驅動的佔有量」乘上「報酬權重」;遷移的精確度,僅取決於線性報酬假設成立的程度。
又称
另见