「苦涩的教训」(the bitter lesson)
/ thuh BIT-er LES-un /
「苦涩的教训」,是AI研究者理查德·萨顿2019年一篇简短而影响深远的随笔。它主张:纵观AI七十多年的历史,同一个模式反复上演——那些单纯依靠更多算力的方法(通用的学习与搜索,你给它越多数据和处理能力,它就越好),最终会击败那些建立在精巧、由人手工打造的知识之上的方法。之所以叫「苦涩」,是因为研究者觉得它令人难堪:他们满怀珍爱、亲手工程进系统的那些优雅洞见,往往被仅靠「上规模」的蛮力方法碾平。
历史为它背书。在国际象棋上,数十年来对特级大师棋略的编码,败给了搜索海量局面的引擎。在围棋上,手工调校的启发式规则,败给了从海量自我对弈中学习的系统。在语音识别、机器翻译和计算机视觉上,那些建立在人类专长之上、精心设计的特征,一次又一次被「用更多算力、更多数据训练的通用模型」反超。每一次,这个领域的本能都是把「我们对问题的了解」内建进去;每一次,持久的胜利却来自那些「自己去把它学会」的通用方法。
把它当作一个发人深省的论点,而非福音——并留意它的局限,萨顿的批评者对此向来毫不客气。缩放既不免费也非无限:它要烧掉巨量的算力、能源和数据,抬高成本、引发环境忧虑,而且有迹象表明轻易得来的收益正在放缓。这教训也并不是说人类的知识无用——它说的是:别以「会给系统的学习能力封顶」的方式把知识写死;那些帮助模型去学的结构(比如架构本身的设计),本身就是人类的贡献。最好把它读作一种强烈、来之不易的偏向——偏向通用、可扩展的方法,一记反对过度工程的警钟——而不是一条「算力越多就总能赢」的定律。
早期的围棋程序手工编入了人类的战略原则,却卡在了业余水平。AlphaGo及其后继者,基本抛开了手工编码的智慧,转而从海量的自我对弈与搜索中学习,碾压了世上最顶尖的棋手。数十年精心工程出来的围棋知识,其分量远不及「让一个通用方法在规模上去学」——这就是浓缩在一盘棋里的苦涩教训。
围棋:手工编码的人类战略,败给了一个在规模上学习的通用方法。
苦涩的教训是一个论点,而非一条已证明的定律。它是一种强烈的偏向——偏向通用、可扩展的方法,而非手工打造的知识——但缩放有实实在在的局限(成本、能源、数据),而且「别把知识写死」并不等于「人类的洞见一文不值」。把它读作一记反对过度工程的警钟,而非「算力越多就总能赢」的承诺。