進階策略優化

重要性比率裁剪(importance ratio clipping)

當你重複利用某個策略蒐集到的資料,去評估或改善另一個不同的策略時,必須用重要性比率(importance ratio)重新加權每個樣本:新策略採取該動作的機率比舊策略高或低多少。麻煩在於這個比率可能爆掉。如果新策略強烈偏好某個行為策略很少嘗試的動作,單一個罕見樣本就會被乘上一個巨大的權重,它的雜訊蓋過其他一切,讓更新變得極不穩定。

裁剪把比率封在一個上限,以一點點偏差換取變異的大幅下降。封頂後的估計量不再完美修正同策略與否的落差,卻能阻止任何單一轉移主宰整批資料,因此即使遠離資料分佈也能維持學習穩定。這一個想法支撐了 PPO 的裁剪目標、分散式 RL 中 V-trace 的截斷修正,以及許多必須從陳舊或共享經驗中學習的離策略演員—評論家方法。

\bar\rho_t=\min\!\Big(\bar\rho,\ \tfrac{\pi(a_t\mid s_t)}{\mu(a_t\mid s_t)}\Big)

把「目標策略 / 行為策略」的機率之比封在上限 rho-bar。

又称
importance weight clippingtruncated importance sampling