基礎

阿爾法圍棋(AlphaGo)

/ AL-fuh-goh /

AlphaGo是DeepMind打造的程式。2016年,它擊敗了世界頂尖的一位圍棋高手——圍棋這門古老的棋戲,長久以來被認為遠非電腦所能企及。西洋棋在1997年敗給了深藍的蠻力計算,圍棋卻頂住了:它的棋盤大到「可能的對局比宇宙中的原子還多」,所以你根本無法靠「算」算到最佳的一手。攻克圍棋之所以是一道分水嶺,恰恰因為它要求的,是更接近「判斷」而非「數數」的東西。

AlphaGo的不同之處,在於它會學習。它把深度神經網路——一個網路用來判斷一個局面有多好,另一個用來提示有希望的著法——與一種巧妙的、受引導的搜尋結合起來,用這兩個網路只去探索最值得的那些可能性,而不是全部。它先在人類對局的棋譜上接受訓練,再透過與自己對弈數百萬盤來提升,從自己的經驗中變強。這場「學習」(聯結主義)與「搜尋」的聯姻,正是整個故事的核心:它與其說是把這盤棋「算」贏了,不如說是為它培養出了一種學來的「直覺」。

誠實地說說它的意義:AlphaGo仍然是一個窄系統——精於圍棋,別的什麼也做不了——但它戲劇性地證明了,深度學習加上自我對弈,能征服一個對當年戰勝西洋棋的蠻力方法而言「太大、也太微妙」的問題。在著名的第二局裡,它落下一手怪招,人類專家起初以為是失誤,隨後才意識到它原創得深刻——這生動地表明,機器學到的是策略,而非死記了人類的棋路。AlphaGo成了深度學習時代一個標誌性的象徵,並啟發了一脈後繼者:它們從零開始自學棋藝,還去攻克諸如蛋白質折疊這樣的科學難題。

在2016年的那場對局中,AlphaGo於第二局走出的「第37手」讓解說者大吃一驚——那是一個沒有哪位人類高手會選擇的落子,起初被當成失誤,結果卻妙不可言。它讓人窺見了一台從經驗中學出自己策略、而非照搬人類習慣的機器,而這絕不可能單憑蠻力數數得來。

AlphaGo的「第37手」:學來的策略的證據,也是它區別於深藍式計算的標誌。

AlphaGo比深藍跨出的那一步,是「學習」,而不只是算力更強:它把神經網路與受引導的搜尋結合,並靠自我對弈來提升。然而它依舊是窄的——精於圍棋,別處無用——這提醒我們,即便是驚艷的勝利,也仍是單一領域的功業。

又稱
DeepMind AlphaGo阿尔法围棋阿爾法圍棋阿尔法狗