深度強化學習基礎
循環回放強化學習(recurrent replay RL)
堆疊畫面能處理短暫的運動爆發,但有些環境藏了太多——牆後是什麼、你看過且必須記住的一個數字——以致任何固定的近期畫面視窗都不夠。解法是給智能體一個記憶,通常是像 LSTM 這樣、把隱藏狀態沿時間帶著走的循環網路。循環回放強化學習就是離策略訓練這種智能體的方法:你儲存並回放整段轉移序列,而非單筆,好讓循環有一條時間線可以展開。
困難之處在於隱藏狀態。從緩衝區拉出的一筆轉移,是在智能體累積出的某個循環狀態下經歷的,但那個狀態是由舊版本的網路產生、且沒有被儲存。從歸零的隱藏狀態回放序列會扭曲學習。這個領域裡深具影響力的智能體 R2D2,靠著把循環狀態存進緩衝區、並在計算損失前燒入一段暖身前綴步驟以重建隱藏狀態,來解決這件事。這讓大規模的循環離策略智能體變得可行,並創下強勁的 Atari 紀錄。
又称
另见