深度強化學習基礎

Rainbow DQN(彩虹 DQN)

到了 2017 年,DQN 家族已長出五、六個各自獨立的改進,每一個都單獨發表、各有幫助。Rainbow 問了個顯而易見的問題:它們能疊加嗎?它把其中六個合進單一智能體——雙重 DQN、優先回放、對決架構、多步回報、分布式價值學習,以及用於探索的噪聲網路——而答案是肯定的:這個組合勝過任何單一成分,在 Atari 上創下新的最佳成績。

除了是個強大的智能體,Rainbow 也是一堂關於各部件如何互動的課,因為作者還做了消融實驗,一次移除一個元件。結果分布式學習與優先回放貢獻最大;移除噪聲網路或對決架構的傷害較小。這種仔細探究到底哪些部分真的重要的研究,比應有的還罕見。Rainbow 至今仍是一個標準的強基線,是一個新的價值式方法被期待要拿來比較的對象。

又称
Rainbow