進階策略優化
V-trace 離策略修正(V-trace off-policy correction)
大規模強化學習常常讓數百個行動者平行產生經驗,由一個中央學習器更新策略。等到一條軌跡傳抵學習器時,策略往往已經前進了,所以資料略帶離策略性——是由一個落後於當前目標策略的行為策略蒐集的。V-trace 隨 IMPALA 架構提出,正是讓學習器仍能從這些陳舊、分散的經驗算出正確價值目標、而不必把它丟掉的修正。
它的做法,是用時間差誤差建構自助式的價值目標,每一項都以裁剪過的重要性比率加權。兩個分開的裁剪層級各司其職:一個封得較低的比率,控制修正沿軌跡往回傳播多遠、把變異壓住;另一個逐步比率,則決定價值函數收斂到的定點。裁剪以受控的偏差,換取在眾多落後行動者之間穩定、低變異的學習,使 V-trace 成為高吞吐分散式 RL 系統的支柱。
v_s=V(s)+\sum_{t\ge s}\gamma^{\,t-s}\Big(\textstyle\prod_{i=s}^{t-1}c_i\Big)\,\rho_t\,\delta_t V,\quad \rho_t=\min(\bar\rho,\tfrac{\pi}{\mu}),\ c_i=\min(\bar c,\tfrac{\pi}{\mu})
自助式價值目標,搭配兩個分別裁剪的重要性比率。
又称
另见