基础

阿尔法围棋(AlphaGo)

/ AL-fuh-goh /

AlphaGo是DeepMind打造的程序。2016年,它击败了世界顶尖的一位围棋高手——围棋这门古老的棋戏,长久以来被认为远非计算机所能企及。象棋在1997年败给了深蓝的蛮力计算,围棋却顶住了:它的棋盘大到「可能的对局比宇宙中的原子还多」,所以你根本无法靠「算」算到最佳的一手。攻克围棋之所以是一道分水岭,恰恰因为它要求的,是更接近「判断」而非「数数」的东西。

AlphaGo的不同之处,在于它会学习。它把深度神经网络——一个网络用来判断一个局面有多好,另一个用来提示有希望的着法——与一种巧妙的、受引导的搜索结合起来,用这两个网络只去探索最值得的那些可能性,而不是全部。它先在人类对局的棋谱上接受训练,再通过与自己对弈数百万盘来提升,从自己的经验中变强。这场「学习」(联结主义)与「搜索」的联姻,正是整个故事的核心:它与其说是把这盘棋「算」赢了,不如说是为它培养出了一种学来的「直觉」。

诚实地说说它的意义:AlphaGo仍然是一个窄系统——精于围棋,别的什么也做不了——但它戏剧性地证明了,深度学习加上自我对弈,能征服一个对当年战胜象棋的蛮力方法而言「太大、也太微妙」的问题。在著名的第二局里,它落下一手怪招,人类专家起初以为是失误,随后才意识到它原创得深刻——这生动地表明,机器学到的是策略,而非死记了人类的棋路。AlphaGo成了深度学习时代一个标志性的象征,并启发了一脉后继者:它们从零开始自学棋艺,还去攻克诸如蛋白质折叠这样的科学难题。

在2016年的那场对局中,AlphaGo于第二局走出的「第37手」让解说者大吃一惊——那是一个没有哪位人类高手会选择的落子,起初被当成失误,结果却妙不可言。它让人窥见了一台从经验中学出自己策略、而非照搬人类习惯的机器,而这绝不可能单凭蛮力数数得来。

AlphaGo的「第37手」:学来的策略的证据,也是它区别于深蓝式计算的标志。

AlphaGo比深蓝跨出的那一步,是「学习」,而不只是算力更强:它把神经网络与受引导的搜索结合,并靠自我对弈来提升。然而它依旧是窄的——精于围棋,别处无用——这提醒我们,即便是惊艳的胜利,也仍是单一领域的功业。

又称
DeepMind AlphaGo阿尔法围棋阿爾法圍棋阿尔法狗