策略梯度方法

離策略策略梯度(off-policy policy gradient)

純策略梯度是同策略的:每次更新都必須用你正在改進的那個策略產生的新鮮資料,這很浪費——每個批次用一步就丟。離策略策略梯度讓你能用「另一個策略」蒐集的資料,計算「目前策略」的梯度:重播緩衝區裡的舊經驗、一個獨立的探索行為策略,甚至人類示範。回報是樣本效率。

標準的修正是重要性抽樣:把每個抽到的轉移,依新策略機率對行為策略機率的比值 π_θ(a|s) / b(a|s) 重新加權。這原則上讓梯度不偏,但這個比值很險惡——當兩個策略不一致時它會爆掉,變異數隨之失控。實際方法用裁剪(如 PPO)、截斷(V-trace),或改用完全繞開比值的確定性梯度來馴服它。

誠實的取捨是偏誤對變異數對資料重用。離策略方法重用資料、可以大幅提升樣本效率,但重要性權重增加變異數與不穩定,而過大的策略落差會讓它們崩潰。現代演算法設計很大一部分——重播、裁剪目標、信賴域——談的都是如何安全地拉大你能離策略到什麼程度。

\nabla_\theta J\approx\mathbb{E}_{(s,a)\sim b}\!\left[\frac{\pi_\theta(a\mid s)}{b(a\mid s)}\,\nabla_\theta\log\pi_\theta(a\mid s)\,\hat{A}(s,a)\right]

用機率比值替另一個策略的資料重新加權,以修正梯度。

又称
off-policy actor-critic