深度強化學習基礎

雙重 DQN(Double DQN)

標準 DQN 有個系統性缺陷:它目標中的 max 既挑出最好的下一個動作,又從同一個帶雜訊的網路讀出那個動作的價值。只要估計值含有隨機誤差——而它們總是有——取最大值就會偏好那些價值剛好被高估的動作,於是目標被往上偏。誤差層層累積,價值膨脹,智能體變得過度自信。雙重 DQN 用一個小改動去掉這份過度樂觀。

解法是把兩件工作拆開。用線上網路去挑下一個狀態裡哪個動作看起來最好,但用另一個目標網路去評估那個被選中動作的價值。因為動作由兩個不同的網路分別選取與評分,被其中一個高估的動作不太可能同時被另一個高估,向上的偏差大致相互抵消。它幾乎不花成本——目標網路本來就存在——卻能在整套 Atari 上明顯提升價值準確度與最終分數。

y = r + \gamma\, Q_{\theta^-}\!\big(s',\,\arg\max_{a'} Q_{\theta}(s',a')\big)

用線上 theta 選動作、用目標 theta-minus 評估