策略梯度方法

變異數削減(variance reduction,策略梯度的)

策略梯度最具定義性的實務問題就是雜訊:每個梯度估計都由隨機回合堆出,因此它在真實方向四周劇烈散落,學習爬得很慢。變異數削減是一整族技巧的統稱,它們在不讓梯度偏離航道(也就是不引入偏誤)的前提下安撫這份雜訊。精通它們,幾乎就是教科書版 REINFORCE 與堪用智能體之間的差別。

標準工具箱大致依影響力排序:減去基準線(最好是學到的 V(s)),讓只有高於平均的動作被強化;用「未來報酬」,讓每個動作只記它能影響到的獎勵;學一個評論家、用優勢取代完整報酬;用 GAE 混合各視界;對許多平行演員取平均以縮小估計式的變異數;以及裁剪或正規化梯度,讓更新維持合理尺度。

天下沒有白吃的午餐:有些削減器,如學到的評論家或 λ<1 的 GAE,用一點偏誤換來大量變異數的下降,這通常划算,但必須盯著。訣竅在於挑選那些你能容忍其殘餘偏誤的削減器,並認清:一個演算法幾乎所有的設計——基準線、優勢、批次處理——其實都是變異數削減的化身。