連續控制
柔性演員–評論家(soft actor-critic, SAC)
SAC 是連續控制另一隻現代主力,核心想法是把目標換掉:別只追求最大化獎勵,而是最大化「獎勵加上策略的隨機性」。具體而言,它在智能體仍把事情做好的前提下,獎勵它讓動作盡量多變。聽起來像怪癖,卻造就一個探索徹底、不押注於單一脆弱策略、且對超參數遠比 DDPG 或 TD3 穩健的智能體——這也是人們偏愛它的一大原因。
機制上 SAC 是一個離策略的演員–評論家,配上隨機的、通常經 tanh 擠壓的高斯策略。它沿襲 TD3 一脈的截斷式雙 Q 評論家來對抗高估,並用重參數化技巧訓練演員,好讓加了熵的目標擁有低變異數的梯度。價值目標帶有額外的熵獎勵,而一個溫度參數決定那份獎勵的份量。每一塊——熵項、雙評論家、重參數化抽樣——都是本領域別處的獨立條目,而 SAC 正是它們組裝起來的地方。
實務上 SAC 樣本效率高又寬容,常是新機器人或控制任務最先嘗試的選擇,而它的自動溫度調整還拿掉了最後幾顆難調的旋鈕之一。它在理念上的對立面是確定性的 TD3:SAC 靠本質上的隨機來探索,TD3 則靠把外部雜訊注入一個確定性策略。
又称
另见