深度強化學習基礎

目標網路(target network)

當 DQN 把 Q(s,a) 朝它的目標更新時,右邊那個目標是由正在訓練的同一個網路算出來的。於是每一次權重更新也改變了目標,就像你要射飛鏢,靶卻在你出手的瞬間往旁邊一晃。這個回饋迴圈讓天真的深度 Q 學習震盪或發散。目標網路藉由保留一份凍結的網路副本來算目標,打斷這個迴圈。

你維持兩套權重:線上網路,每一步都更新;以及目標網路,是線上權重的一份快照,只偶爾刷新——每一萬步整份複製過去,或每次更新以一個很小的步長慢慢混入。由慢速副本算出的目標會穩定一段時間,給線上網路一個固定的東西去追。它與經驗回放並列為兩根支柱,把用神經網路做的 Q 學習從不穩定變成可靠。

\theta^- \leftarrow \tau\theta + (1-\tau)\theta^-

以小 tau 進行的軟目標更新