基础

基础模型(foundation model)

/ fown-DAY-shun MOD-ul /

基础模型,是指在一大堆庞杂、宽泛的数据上——文本、图像,或二者兼有——训练出的单个超大模型,目的在于日后能被适配到许多不同任务上,而不必为每项任务从零另起炉灶。这个名字道出了核心:它是一个公共的「地基」,你在它之上盖起许多具体的应用,就像一块结实的混凝土基座可以撑起一栋住宅、一间店铺,或一座写字楼。今天聊天机器人背后的大语言模型,就是最广为人知的例子。

让它成立的,是一套两阶段的配方。第一步是预训练:模型消化一个庞大而通用的语料,在不针对任何单一工作的情况下,学到语言或视觉的丰富规律——这一步极其昂贵,且只做一次。第二步是适配:同一个模型被微调、被提示,或以其他方式专门化,以应对某项具体任务——给法律文件做摘要、回答客户提问、为照片配字幕——而代价只是预训练的极小一部分。2018至2020年间这类模型的浪潮,以及2021年「基础模型」一词的提出,标志着一个转变:从「每项任务造一个窄模型」,转向「处处复用同一个通用模型」。

好处在于覆盖面与效率:一个模型能驱动无数下游用途,且往往灵活得出人意料。而诚实地说,那些坏处同样重要。这些模型训练起来昂贵又耗能;它们会吸收训练数据里的偏见与错误;它们能流利又自信地说出虚假之词(即所谓「幻觉」);又因为有这么多东西押在少数几个大模型上,它们的缺陷会广泛传播开来。它们是强大的通用工具——而不是神谕,也不是心智。

一家医院、一间律所、一个游戏工作室,可能都建立在同一个底层语言模型之上。医院用病历对它做微调,律所提示它起草合同,工作室用它来写对白。一个昂贵的地基,三个便宜而迥异的应用——而这个地基里的任何缺陷或偏见,都会悄悄出现在这三者之中。

一个昂贵的基础模型,许多便宜的专门用途——还有随它一同传播的共有缺陷。

基础模型的「通用」,指的是可跨任务复用——而不是「通用人工智能」那个意义上的通用。它仍然是一个模式匹配器,能说得既流利又自信地犯错;用途之广,并不等于它真的理解。

又称
base modelpretrained model基础模型基礎模型基座模型