自然语言处理

大语言模型(large language model)

/ larj LANG-gwij MOD-uhl /

大语言模型是一张庞大的数字之网,靠一个简单的游戏训练出来:读一段文字,猜下一个词。把这个游戏在人类写下的海量内容上反复玩——书籍、代码、对话、整个开放网络——模型便慢慢学会了语言的规律。它有点像手机上的输入法联想,只是规模大到惊人,于是它不再只是补完一句话,而能写出整篇文章、翻译一首诗,或讲解一道菜谱。

在它的内部,是一种叫做「变换器」(transformer)的架构,其核心绝招叫「注意力」:阅读时,模型会权衡前面哪些词对猜测下一个词最重要,从而在长段落里把握住意义。凭着数十亿个可调的旋钮和海量的训练文本,它建立起一张关于词与词如何关联的丰富内部地图。

真正让这类模型了不起的,是一个意外之喜:没有人手工把语法、事实或推理写进去。一旦模型与训练规模足够大,这些能力便自行「涌现」——规模的跃升带来能力的跃升。一个常见的误解,是以为模型在「查资料」或真的「懂了」;其实它只是在预测看似合理的词。这也是为什么它可能口气笃定却答错——人们把这种失误称为「幻觉」。

给定「那只猫坐在___上」,模型给「垫子」很高的概率,给「屋顶」较低的概率,给「民主」极小的概率——再从这个分布中挑选。

是预测,而非记忆调取:大语言模型刻画的是下一个词元的概率。

这一突破可追溯到 2017 年的论文《Attention Is All You Need》,它提出了变换器架构;名字里的「大」指的纯粹是规模——参数量与训练数据之多。「GPT」是 OpenAI 旗下模型的名字,意为「生成式预训练变换器」,它只是大语言模型中一个广为人知的家族——许多领先的模型,如 Gemini、Claude、LLaMA,并不是 GPT。

又称
LLM大语言模型大型語言模型foundation model基础模型基礎模型