連續控制

擠壓高斯策略(squashed Gaussian policy)

真實致動器都有極限——馬達會飽和、方向盤會打到底——所以連續策略必須輸出落在有界框內的動作,譬如介於 −1 到 1。作為隨機連續策略最自然選擇的純高斯,卻有無窮長的尾巴,會樂呵呵地提出遠超任何極限的動作。擠壓高斯的修法是:先從高斯抽樣,再把樣本送過一個 tanh 函數,把整條實數線溫和地彎進開區間 (−1, 1)。

於是策略先產生一個無界樣本 u = μ_θ(s) + σ_θ(s)·ε,動作則是 a = tanh(u)。這在構造上就保證每個動作合法,同時保持可微分,因此能與重參數化梯度完美搭配。有一筆帳要記:擠壓會改變機率密度,所以熵項用到的對數機率需要一個修正項,也就是 tanh 導數的對數行列式——很容易漏掉,是微妙 bug 的經典來源。

這是柔性演員–評論家內部的預設策略類別,也是連續控制裡常見的選擇。它一次撮合三個需求:用於探索與熵的隨機策略、對動作界限的遵守、以及供低變異數學習的平滑可微分路徑。tanh 確實有個缺點——靠近邊緣時的飽和會把梯度壓平——這也把它連到了動作飽和這個陷阱。

a=\tanh\big(\mu_\theta(s)+\sigma_\theta(s)\,\varepsilon\big),\quad \varepsilon\sim\mathcal{N}(0,1)

抽一個高斯樣本,再經 tanh 擠壓進有界的動作範圍。

又称
tanh-Gaussian policy