應用、環境與模擬到真實

AlphaZero(自我對弈強化學習,self-play RL)

AlphaZero 學會西洋棋、將棋與圍棋,達到超越人類的強度,而它的起點只有規則——完全不用任何人類棋譜。它靠和自己對弈而精進,每個新版本都成為稍強一點的陪練對手,於是整個系統從亂下一路自助拔升到世界級。

單一個神經網路同時輸出落子策略與盤面價值。對弈時,蒙地卡羅樹搜尋(MCTS)用這個網路引導其前瞻,產出比網路本身更好的著手;這些搜尋結果接著成為訓練目標,於是網路把搜尋蒸餾進自己,而搜尋又持續變得更銳利——形成良性循環。自我對弈則源源不絕地供應難度恰到好處的新鮮資料。

AlphaZero 把較早的 AlphaGo(曾使用人類棋譜與手工特徵)一般化成一套乾淨的演算法;之後的 MuZero 更進一步,連知道規則都不需要,而是自行學出一個遊戲的模型。

又稱
AlphaZeroself-play with search