應用、環境與模擬到真實

強化學習用於遊戲對弈(RL for game playing)

遊戲是 RL 最愛的試煉場——規則明確、分數清楚,又能無限量地廉價練習,所以智能體可以打上百萬場對局,並精確地衡量自己的進步。這個領域的里程碑成果,從 Atari 到圍棋,再到星海爭霸與 Dota,全都來自遊戲。

不同遊戲考驗不同的技能。從像素玩 Atari 需要感知與功勞分配;棋類遊戲需要長程規劃與搜尋;即時戰略遊戲更疊加了部分可觀測、龐大的動作空間與團隊協調。方法則橫跨以價值為本的學習(DQN)、策略梯度與行動者—評論家,且常與自我對弈和樹搜尋結合。

精通某個遊戲,並不會自動遷移到雜亂的真實任務。遊戲遞給智能體一個完美的模擬器、密集而即時的回饋,以及單一固定的目標——這三項奢侈,真實世界幾乎從不提供。

又称
game-playing agentssuperhuman game AI