強化學習

自我對弈(self-play)

/ SELF-play /

自我對弈是一個優雅的想法:讓智能體透過與自己的副本對弈來學習,既無人類對手,也無人類對局可供模仿。它破解了一個先有雞還是先有蛋的難題:要變強,你需要一個強勁的對手,可在任何強者出現之前,你又上哪兒去找這樣一個對手?答案是,拿你自己當對手。隨著你進步,你的對手(也是你)也跟著進步,於是挑戰的難度自動與你同步——就像永遠在跟一個恰好與你同等水平的人對弈,兩人一道,永無止境地一寸寸向上攀。

正是這道自動的爬坡,讓自我對弈如此強大。智能體面對著一架沒有盡頭的對手之梯,每一級都比上一級略強,由此生成一套沒有任何人類能手工設計出來的訓練課程。DeepMind 的 AlphaGo Zero 與 AlphaZero 把這個想法推到了最純粹的形態:僅從圍棋、西洋棋或將棋的規則出發——零份人類棋譜——它們與自己對弈了數百萬局,超越了此前所有的程式和人類冠軍。那些知識,完完全全來自自我對弈這個循環。

要把它「證明了什麼、沒證明什麼」說精確。自我對弈在那種「雙人、定義完美、零和」的遊戲裡光彩奪目——那裡規則被精確知曉,「贏」也毫不含糊。這是一個狹窄而特殊的場景。它無法直截了當地遷移到那個一團亂麻的現實世界:那裡規則未知、目標模糊、沒有一個乾乾淨淨的對手,你也無法免費地模擬上百萬次試驗。自我對弈還可能崩塌——它會去追逐自己的怪癖,忘了該如何打敗更老的策略——這正是為什麼真實系統會小心地留著一池過往版本來對弈。它是一件出色的工具,而非通向通用智能的配方。

AlphaZero 起初只知道西洋棋的規則——沒有開局定式、沒有人類對局、沒有任何戰略。它與自己對弈了數小時,便自行重新發現了人類幾個世紀積累的棋理,進而創造出連特級大師都感到震驚的新穎思路,並乾淨俐落地擊敗了當時最強的西洋棋程式。

靠與自己對弈從零學起——在乾淨的零和遊戲裡耀眼奪目,卻不是一條直通現實世界的路。

自我對弈那些超越人類的戰績,活在一個特殊的世界裡:雙人、規則精確已知、勝負訊號清晰、且能無限地免費模擬。一旦剝去這些條件——幾乎所有現實任務都是如此——這個把戲便無法乾淨地遷移,甚至可能因過度擬合自己的習慣而退化,除非你刻意地讓它持續與自己更老的版本對弈。

又稱
self play自我对弈自我博弈AlphaGoAlphaZero