階層式強化學習與選項

通用價值函數近似器(universal value function approximators, UVFA)

一般的價值函數只回答一個問題:對我的單一任務而言,這個狀態有多好?通用價值函數則一次回答一整片問題:若我的目標是 g,這個狀態有多好——對你想得到的任何目標 g 皆然。它是單一個函數 V(s, g)——或 Q(s, a, g)——同時吃進「你在哪裡」與「你想達成什麼」,回傳那組配對的期望報酬。

把目標折進函數裡,重點在於跨目標的泛化。一張普通的表必須各自獨立地學每個目標的價值,但一個建立在(狀態, 目標)配對上的神經近似器能共享結構:學會了如何為某個目標評價各狀態後,它能對從未受訓過的目標做出合理內插,因為鄰近的目標通常有相似的價值地貌。這正是讓目標條件式與階層式智能體得以規模化的表示。

UVFA 與事後重標記天生互補,後者製造出它所需學習的大量(狀態, 目標)資料;它也給管理者一個乾淨的辦法去評估哪些目標值得交給工作者。代價是:在聯合空間上學一個函數,比只在狀態上學更難,而糟糕的目標表示會讓泛化崩潰。

V(s,g)\approx\mathbb{E}\!\left[\textstyle\sum_{t}\gamma^{t}\,r_g(s_t)\,\middle|\,s_0=s\right]

一個同時涵蓋狀態 s 與目標 g 的價值函數。

又稱
UVFAuniversal value functions