深度強化學習基礎

深度 Q 網路(Deep Q-Network, DQN)

深度 Q 網路(DQN)是首次證明深度強化學習能大規模奏效的智能體:2015 年它直接從畫面學會玩數十款 Atari 遊戲,許多款用同一套架構與同一組超參數就達到人類水準。你只給它原始像素和分數,它就能自行發現哪些動作能得分。那是強化學習不再只是玩具問題、開始在真實遊戲上勝過人類的時刻。

在底層,DQN 就是 Q 學習,用一個卷積網路為每款遊戲估計 Q(s,a)——也就是每個動作的期望回報。它的訓練是最小化目前估計值與自舉目標(立即獎勵加上 gamma 乘以最佳的下一個價值)之間的差距。兩個技巧讓這件事穩定下來:一個經驗回放緩衝區,打散連續畫面之間的相關性;以及一個獨立的目標網路,把目標暫時固定一段時間。少了任何一個,網路就會去追逐自己不斷移動的預測而發散。

Q(s,a)\leftarrow Q(s,a)+\alpha\big[r+\gamma\max_{a'}Q(s',a')-Q(s,a)\big]

DQN 用網路近似的 Q 學習更新

又称
DQN