連續控制

目標策略平滑(target policy smoothing)

目標策略平滑是 TD3 三處修補之一,它治的是確定性演員–評論家一個陰險的失敗。當演員提出單一最佳動作,而評論家恰好在那裡有個尖銳的假尖峰——一個其實只是函數近似雜訊的過度樂觀凸起——演員就會迫不及待地把策略一路導向那個假峰。平滑讓評論家被迫在每個動作周圍保持平滑,從而拒絕相信刀刃般的尖峰。

機制很小:計算學習目標時,先對目標動作加上一點截斷後的隨機雜訊再去評估評論家,a' = μ(s') + clip(ε)。因為鄰近動作應該有相近價值,這等於在一個小鄰域上對評論家取平均,於是孤立的尖峰被模糊掉,只有真正寬廣的高價值區域才能存進目標。它對價值函數起了正則化作用——內建一個假設:好動作落在平滑的盆地裡,而非針尖上。

概念上,這是把「世界局部平滑」這個先驗烙進演算法的方法:若某動作好,稍有不同的動作也應該好。這個假設在物理控制裡幾乎總是成立——關節角度差一毫米不該翻轉結果——這正是該技巧在那裡如此有效的原因。

y=r+\gamma\,Q_{\bar\phi}\big(s',\,\mu_{\bar\theta}(s')+\mathrm{clip}(\varepsilon,-c,c)\big),\quad \varepsilon\sim\mathcal{N}(0,\sigma^2)

對目標動作加截斷雜訊,讓評論家在一個鄰域上被平均。

又稱
target action noise