序列模型与Transformer

《Attention Is All You Need》(「注意力就是你所需要的一切」)

/ uh-TEN-shun iz awl yoo need /

《Attention Is All You Need》是 2017 年那篇引入 Transformer 的研究论文的标题,它已成为现代 AI 中最具影响力的想法之一的简称。标题里那句挑衅性的主张是:你可以用注意力作为核心机制,搭出一个顶尖的序列模型,并丢掉人人都以为必不可少的逐步递归与滑动卷积。结果证明真的可以——这门领域从此再没回过头。

在这篇论文之前,领先的翻译模型逐词依次处理,这让它们训练缓慢、对长段落健忘。作者们展示了:一个几乎全由注意力与简单前馈层搭成的网络,在翻译上能匹敌甚至胜过那些模型,且训练快得多,因为注意力让整段序列得以并行处理。他们描述的那套架构——编码器与解码器堆、多头注意力、位置编码,一应俱全——经过精炼后,至今仍是几乎每个大语言模型的主干。

值得同时握住两条真相。这篇论文确实是一个转折点:其后几乎一切,从 GPT 到现代聊天机器人,都是它的后裔。但标题是一句口号,而非字面的主张,把它当真是一个常见的错。真正的 Transformer 并非只有注意力——它重重地倚靠前馈块、归一化、残差连接与位置信息,没了这些,注意力什么有用的事也做不成。这篇论文承载的更深一课,与其说是关于注意力本身,不如说是关于一份能扩展的配方:一套简单、可并行的架构,配上海量的数据与算力。

论文在英译德任务上训练了它的 Transformer,以先前最佳成绩零头的训练时间将其击败。几年之内,同一套架构被极大地放大,已在写文章、写代码——这一血脉可直接追溯回这一篇论文。

一篇 2017 年的翻译论文,悄然重塑了整门领域。

标题是修辞,不是工程。一个能用的 Transformer 在注意力之外,还需要前馈块、归一化、残差连接与位置编码——把这些剥掉,单靠注意力几乎学不到东西。真正的要义,是一份可扩展、可并行的配方,而非「注意力真能独自胜任」。

又称
the Transformer paperVaswani et al. 2017注意力就是你所需要的一切Transformer 论文