階層式強化學習與選項

目標條件式強化學習(goal-conditioned RL)

一般情況下,一個策略用一個固定獎勵學一個任務。目標條件式策略則把目標當成明確的輸入,一次學整族任務:餵它「去廚房」它就去廚房,餵它「去臥室」它就去那裡,全出自同一個網路。智能體不再是某個終點的專才,而是一個通用控制器,你能把它指向任何它受過訓的目標。

具體而言,策略與價值函數都多了一個參數 g,也就是想要的目標,通常表示成一個目標狀態或某個目標空間裡的一點。獎勵是相對於目標定義的——典型做法是抵達它給一點小獎、其餘幾乎沒有——於是智能體學的是「如何抵達各種東西」這件通則,而非「如何抵達某一樣東西」。這正是管理者–工作者階層中工作者所需要的介面,也是目標條件之所以居於階層式強化學習核心的原因。

最大的優勢是泛化與重用:為某個目標學到的技能能轉移到鄰近的目標,單一個智能體就覆蓋一整段連續的任務。最大的難處則是稀疏獎勵——起初大多數目標很少被抵達,智能體幾乎看不到成功的範例。這個問題,正是事後重標記與通用價值函數所要解決的。

又称
goal-conditioned policiesmulti-goal RL