強化學習理論

柔性演員-評論家(soft actor-critic, SAC)

柔性演員-評論家是用於連續控制的離策略(off-policy)演員-評論家方法,它不只追逐報酬,還希望在把事情做好的同時讓策略盡量保持隨機。想像一個代理人在其他條件相同時,寧可保留選擇空間,也不願太早把寶押在單一動作上。把這種隨機性當成額外獎勵,能讓代理人廣泛探索,並在環境略有變動時依然穩健。

具體而言,它最佳化一個最大熵(maximum-entropy)目標:期望報酬再加上溫度係數乘以每一步策略的熵。它透過柔性貝爾曼(soft Bellman)回溯把熵項摺進目標來學習柔性 Q 函數,並用重參數化技巧(reparameterization trick)訓練一個高斯隨機策略,去逼近柔性 Q 的波茲曼分布。雙 Q 網路取較小值可抑制高估,而溫度係數則透過把期望熵維持在目標值上自動調整。

因為能從重播緩衝區重複利用離策略資料,它是最具樣本效率且最穩定的連續控制方法之一。主要的提醒是它對報酬尺度敏感,因為報酬尺度其實隱含決定了熵的權重,也對所選的熵目標值敏感。

J(\pi)=\sum_t \mathbb{E}_{(s_t,a_t)\sim\rho_\pi}\big[r(s_t,a_t)+\alpha\,\mathcal{H}(\pi(\cdot\mid s_t))\big]

最大熵目標:期望報酬,再加上每一步以溫度加權的策略熵。

報酬量級一變,等於也改變了熵的權重;自動溫度調整能緩解表徵,但重新縮放後的報酬仍會改變行為。

又称
SAC柔性演員-評論家