深度強化學習基礎

Atari 基準(Atari benchmark)

Atari 基準是一組老式 Atari 2600 電玩——Pong、打磚塊、太空侵略者、蒙特祖瑪的復仇等數十款——透過街機學習環境(Arcade Learning Environment)打包成深度強化學習的共同試驗場。它的吸引力在於:同一個智能體必須只靠同樣的原始像素與分數訊號學會全部遊戲,不做任何針對個別遊戲的工程。在 DQN 用它一款接一款證明單一演算法能在差異極大的挑戰上達到人類水準之後,它成了這個領域共用的標尺。

表現通常以人類正規化分數回報:零是隨機亂玩,一百是人類測試者,而把整套五十多款遊戲的中位數或平均數綜合起來,就概括了一個智能體。它是個豐富的基準,因為這些遊戲橫跨反射式的瞬間操作到長程的探索——尤其是獎勵稀疏的蒙特祖瑪的復仇,赤裸裸暴露了基本 DQN 探索得有多差。批評者指出,確定性的 Atari 可以靠背軌跡來鑽漏洞,這也是後來加入黏性動作等隨機性的原因。

又称
Arcade Learning EnvironmentALE