連續控制

雙延遲 DDPG(twin delayed DDPG, TD3)

TD3 是動了三處針對性修補的 DDPG,也是當 DDPG 一再翻車時該伸手去拿的演算法。它的名字道出了前兩處:雙評論家與延遲更新。背後的診斷是:DDPG 會系統性地高估動作有多好——演員學會去鑽任何評論家過度樂觀的狀態,而那份誤差會不斷複利,直到學習脫軌。TD3 正面迎擊這份高估。

三處修補是:保留兩個獨立評論家,在組成學習目標時取兩者價值估計中較小者,讓樂觀的那個無法暴衝(截斷式雙 Q);演員與目標網路的更新頻率低於評論家,讓價值估計先安定下來,策略再去追(延遲);以及對用於目標的動作加上一點雜訊,逼評論家保持平滑、無法咬住一個尖銳的假峰(目標策略平滑)。每一項單獨都不大;合起來卻徹底改變了穩定性。

TD3 保留了 DDPG 的確定性演員與離策略重播,所以它是即插即用的升級,而非新範式,在連續控制基準上常是最強的確定性方法。它的主要對手是 SAC——後者改以隨機性與熵取勝;兩者之間實務上的取捨,通常得逐任務以實驗定奪。

又称
TD3