蒙地卡羅與時間差分學習

雙重 Q-learning(double Q-learning)

一般的 Q-learning 有高估動作價值的毛病,因為同一組帶雜訊的數字既被用來挑出最好的下一動作,又被用來評斷它有多好——而剛好往上走運的那個動作往往會勝出。雙重 Q-learning 打破這個自我增強的迴圈,做法是保有兩張各自獨立的價值表,讓它們互相校驗。

每次更新時,它隨機挑一張表來選出它認為最好的動作,再從另一張表讀取那個動作的價值來形成目標。因為「選動作的表」和「評價值的表」不同,一張表裡那份往上的運氣就不再餵回它自己的估計,系統性的高估也大致互相抵消。這種解耦正是後來被帶進深度強化學習 Double DQN 的核心想法。

又稱
double Qdouble estimator