進階策略優化

階段式策略梯度(phasic policy gradient, PPG)

多數演員—評論家方法把策略和價值函數一起訓練,常常透過一個共享網路。這種共享造成一種張力:價值函數想對同一批資料做許多次優化以精準擬合,但策略不能在陳舊資料上訓練太久,否則會漂成離策略、把學習弄不穩。階段式策略梯度的解法,是把兩者拆成不同階段,而非同時優化。

在策略階段,PPG 做一次正常的 PPO 式更新,只跑少數幾遍,讓策略貼近產生它的資料。接下來的輔助階段,它在累積的資料上把價值函數多訓練好幾個 epoch,並加上一個輔助目標,把價值知識蒸餾進共享表徵裡,同時用一個 KL 項讓策略輸出不要改變。這使價值頭能為了精準而被狠狠優化,卻不會把策略過度優化,從而提升樣本效率與共享特徵的品質。

又稱
PPG