深度強化學習基礎

經驗回放(experience replay)

想像一個學生不是把每一頁讀過一次就忘掉,而是把每一頁都收進資料夾,每晚隨機抽幾頁重讀。經驗回放替智能體做的就是這件事:它經歷的每一筆轉移——狀態、動作、獎勵、下一個狀態——都被丟進一塊記憶體,訓練時從那塊記憶體隨機抽取批次,而不是只用最新的一刻。舊的教訓會被重溫許多次,遠在產生它的情境早已過去之後。

這一次解決兩個問題。第一,連續的轉移高度相關——一連串幾乎相同的畫面——而梯度方法假設樣本大致獨立,所以隨機抽樣把它們去相關。第二,它提升資料效率,因為每一次與環境的昂貴互動都被重複使用數十次,而非一次。回放正是讓 DQN 這類離策略深度強化學習變得可行的關鍵;它之所以成立,正因為 Q 學習是離策略的,能從當前策略不會產生的資料中學習。

回放只對離策略演算法有效——像原始策略梯度這種在策略方法,未經修正不能重用過時資料。