深度強化學習基礎

優先經驗回放(prioritized experience replay)

均勻回放把每一段儲存的記憶都當成同等值得重溫,但這很浪費——多數轉移平淡無奇、教不了智能體什麼,而少數罕見、令人震驚的轉移卻承載了大部分的教訓。優先經驗回放更常抽取那些令人意外的轉移。意外由時間差誤差衡量:智能體的預測離實際發生的事有多遠。誤差大代表這裡有值得學的東西,那就更早、更頻繁地回放它。

每一筆轉移的取樣機率設成正比於它的 TD 誤差取某次方,於是高誤差事件浮到頂端,而所有轉移仍保有非零的機會。但非均勻取樣會讓梯度產生偏差——你現在是從一個被扭曲的分布學習——所以要套用重要性取樣權重來修正。成果是在許多 Atari 遊戲上明顯比均勻回放學得更快。代價是記帳:優先度必須隨誤差變化更新,通常用一棵和樹(sum-tree)資料結構來高效取樣。

P(i)=\dfrac{p_i^{\alpha}}{\sum_k p_k^{\alpha}},\quad p_i=|\delta_i|+\epsilon

由 TD 誤差優先度決定的取樣機率

又称
PER