策略梯度方法
策略梯度的變異數(variance of policy gradients)
如果你曾看著 REINFORCE 的學習曲線上下顫抖,你就親身遇過這個問題。策略梯度是對抽樣軌跡取平均,而每個樣本都是一次狂野的猜測:同一個策略,可能這回合賺到很棒的報酬、下回合卻很糟,純屬運氣。把少數幾個這種吵雜的數字平均,你估出的方向自身就很吵。
好幾股力量把雜訊疊加起來。報酬 G_t 匯總了許多隨機獎勵,所以它的散布隨視界長度增長。分數因子 ∇_θ log π_θ 可能很大,對自信或近乎確定性的策略尤其如此。長回合把同一個整段軌跡的報酬指派給每個動作,模糊了功勞分配。而估計式的變異數大致與抽樣軌跡數成反比,所以小批次很折磨人。
理解這些來源,就直接告訴你解藥:縮短有效視界(折扣、未來報酬)、把權重置中(基準線、優勢)、借一個評論家取代蒙地卡羅報酬,以及對更多或更多樣的樣本取平均。本質上,現代策略梯度演算法的整套設計,都是在回應這一個數字太大這件事。
另見