連續控制

截斷式雙 Q(連續,clipped double-Q)

價值法強化學習有個慢性病叫高估:因為學習目標對吵雜的價值估計取了最大值(或交給一個最大化的演員),誤差會被系統性地往上偏,而演員學會去鑽任何恰好過於樂觀的估計。截斷式雙 Q 是 TD3 與 SAC 所用、粗暴卻有效的療法。訓練兩個各自獨立參數的評論家,每當你需要一個價值給目標時,就取兩者中較小的那個。

其邏輯是統計性的。若兩個獨立估計式各帶隨機誤差,較大的那個會偏高,所以取最大值會放大高估;相對地,取最小值偏向悲觀,抵消掉大半往上的偏誤。用 min(Q₁, Q₂) 而非單一評論家來寫目標,能讓智能體不去追逐幽靈價值。它是刻意保守了一點——略微低估,是換取「阻止那拖垮 DDPG 的失控過度樂觀」值得付的代價。

這是雙 DQN 的連續動作手足,把離散 Q 學習的做法搬到「無法列舉動作」的演員–評論家情境。它是現代離策略控制中槓桿最高的穩定器之一,而它同時出現在 TD3 與 SAC 裡,正是兩者都遠比純 DDPG 來得穩的一大原因。

y=r+\gamma\,\min_{i=1,2}Q_{\bar\phi_i}(s',a')

用兩個評論家中較小者組成目標,以對抗高估。

又称
clipped double Q-learningtwin-critic min