強化學習理論
事後經驗回放(hindsight experience replay, HER)
事後經驗回放利用一個簡單事實,把失敗化為教訓:就算搞砸的嘗試,也達成了某個結果。如果你想到達目標 A 卻停在 B,你可以事後假裝 B 一直就是目標,於是同一條軌跡瞬間變成一次可供學習的成功,即使真實報酬其實是零。
對採稀疏報酬的目標條件式(goal-conditioned)策略,HER 照常儲存每筆轉移,再加入若干重新標記的副本,其目標換成同一回合稍後實際達成的狀態,通常是最終狀態或隨機選的某個未來狀態。報酬會在替換後的目標下重新計算,於是重播緩衝區裝滿可達成的成功。由於重新標記與資料由哪個策略產生無關,它可搭配任何離策略演算法,如 DQN、DDPG 或柔性演員-評論家。
效果上,HER 從稀疏報酬任務中製造出一套密集而隱性的課程,完全不需要任何人工設計的報酬塑形。
HER 需要一個目標條件式的價值函數,以及能對任何替換目標計算報酬的方法;少了這些,重新標記就沒有可評分的依據。
又称
另见