策略梯度方法

隨機計算圖(stochastic computation graphs)

一般的反向傳播是對一連串確定性運算求微分。但強化學習的目標在中間就嵌了隨機抽樣——你抽一個動作,環境抽一個下一狀態——而你沒辦法用天真的方式對一次擲硬幣反向傳播。隨機計算圖是一套統一框架,用來對含有這類抽樣節點的目標求微分,並對每個節點該怎麼做給出清楚的配方。

穿過抽樣節點有兩條路,而這個框架把選擇講明白。分數函數(似然比)路線對任何抽樣器都適用:把下游的值乘上 ∇_θ log p_θ(x);它通用但高變異。路徑式(重參數化)路線把樣本改寫成 θ 與固定雜訊的確定性函數 x = g_θ(ε),讓一般梯度得以流過;它低變異,但需要抽樣器可微且連續。多數離散動作策略只能用前者;許多連續策略可以用後者。

透過這個視角看強化學習很令人豁然開朗。REINFORCE 不過是動作節點上的分數函數估計式;確定性與 soft actor-critic 方法是穿過策略的路徑式梯度;而這個框架精確告訴你偏誤與變異數從哪裡進來。它是連接策略梯度與更廣闊的可微程式設計與變分推論世界的橋樑。