階層式強化學習與選項

事後目標重標記(hindsight goal relabeling)

這是針對稀疏獎勵問題、一個美得出奇的簡單想法。假設你想去廚房,結果卻走到了走廊。作為一次「去廚房」的嘗試,它是零獎勵的失敗——對學習毫無用處。但事後重標記說:事後假裝走廊從頭到尾就是目標。如今這條一模一樣的軌跡,成了一次完美的成功,充滿關於「如何抵達走廊」的有用訊號。你對廚房一無所獲,卻對如何到處走學了很多。

在機制上,你把每筆轉移在回放緩衝區裡存兩次以上:一次用你原本真正想要的目標,另一次用你實際達成的目標——通常是同一回合稍後造訪過的狀態。在重標記後的目標下,獎勵變成正的,於是即便是一連串名義上的失敗,也能產出大量成功範例。這就是事後經驗回放(HER),它能自然地疊在任何離策略、目標條件式的演算法之上。

在稀疏獎勵、抵達目標的任務上,它的效果可能就是「學不到任何東西」與「學得流暢」之間的差別——本來扁平做幾乎不可能的機器人操作任務,有了 HER 就變得可行。主要的提醒是:它需要一個目標條件式的設定,以及一套能對任意重標記目標計算獎勵的已知方法;而有偏的重標記分布,有時會誤導價值估計。

又稱
Hindsight Experience ReplayHER