連續控制

重參數化策略梯度(reparameterization policy gradient)

當策略是隨機的,計算它的梯度就意味著要「穿過抽樣這個動作」去微分,而做法有兩種。分數函數那條路(REINFORCE)把抽樣器當黑箱,通用卻很吵。重參數化那條路則改寫抽樣,把隨機性抽離成一個固定來源,留下一條從參數到動作的確定性、可微分路徑——而這條路給出變異數低得多的梯度,這在連續控制裡是黃金。

這個技巧很具體。與其直接從一個均值與散度都依賴 θ 的高斯抽動作,不如先抽一個標準雜訊 ε ∼ N(0,1),再設 a = μ_θ(s) + σ_θ(s)·ε。如今 ε 承載了所有隨機性且不依賴 θ,於是你可以把評論家的梯度直接反向傳播穿過 a,就像穿過任何確定性網路一樣。期望的梯度於是化成了一個樣本的梯度,而雜訊已乾淨地從導數裡分離出去。

這正是為何 SAC 的演員用重參數化而非分數函數來訓練:在連續動作、又有一個評論家可以頂著推的情況下,這條路徑式梯度吵雜程度大幅降低,學得更快也更穩。代價是它要求動作是雜訊的可微分函數——這對高斯與經擠壓的高斯成立,對離散選擇則不成立。

a=\mu_\theta(s)+\sigma_\theta(s)\odot\varepsilon,\quad \varepsilon\sim\mathcal{N}(0,I)

把隨機性分離成固定雜訊 ε,讓動作成為 θ 的可微分函數。

又称
pathwise derivative estimatorreparameterized gradient