進階策略優化

代理目標(surrogate objective)

我們真正想最大化的——新策略的期望報酬——很難直接優化,因為要評估它,就得在每個候選更新上都實際執行新策略去蒐集新資料。代理目標是一個我們真的能從手上既有資料算出來的替身。它用重要性取樣,在舊策略走過的狀態分佈下估計新策略的期望優勢,給出一個函數,其在當前策略處的梯度恰好等於真正的策略梯度。

問題在於這個替身只有在附近才忠實;新策略離蒐集資料的那個策略漂得越遠,重要性權重就扭曲得越厲害,估計也越偏離真實報酬。因此每一種進階策略方法都會替代理目標配上一條牽繩——KL 約束、裁剪、或懲罰——把更新留在代理目標可信的區域內。在局部優化代理目標、重新蒐集資料、再重複:這個迴圈就是 TRPO 與 PPO 的骨幹。

L_{\theta_{\text{old}}}(\theta)=\mathbb{E}_{s,a\sim\pi_{\theta_{\text{old}}}}\!\left[\tfrac{\pi_\theta(a\mid s)}{\pi_{\theta_{\text{old}}}(a\mid s)}\,A^{\pi_{\theta_{\text{old}}}}(s,a)\right]

對期望報酬,以優勢加權、重要性取樣得到的估計。

又稱
surrogate losslocal policy improvement objective