幻觉(hallucination)
/ huh-loo-suh-NAY-shun /
幻觉,是指语言模型用「它陈述真事时一样的镇定与自信」,说出某件不实、捏造、或毫无依据之事。它会编出一桩听上去言之凿凿、却从未发生过的官司,引用一篇作者煞有介事、标题却是假的研究,或信心十足地把一个日期记错。要命的是,它丝毫不流露半点犹疑——那条编造的「事实」,与一条正确的,是用同一副流畅、权威的口吻送到你面前的,而这恰恰正是幻觉危险之所在。
之所以会这样,是因为它深植于模型的运作方式之中。语言模型被训练去产出「在前文之下统计上说得通」的文字——而非「经过现实核实」的文字。它没有一座可供查对的独立事实库,也没有一种与生俱来的「这个我其实不知道」的自觉。当它缺了真正的答案,最「说得通」的续写,往往就是一个自信、规整的猜测。模型并不是在「撒谎」——撒谎需要先知道真相、再选择隐瞒;模型只是在生成可能的词,而有时,可能的词恰好是错的。
这不是一个未来某次更新会悄悄修好的小毛病;它是「训练模型去预测说得通的文字」这件事的根本后果。一些技术有帮助——检索增强生成把答案锚定在真实文档上,要求给出出处、或让它表达不确定,也能减少它——但没有什么能将它根除。实用的结论虽不光鲜,却至关重要:凡是要紧的事,请把模型那个自信的事实性断言,当作一条「有待核实的线索」,而非一个「可以信赖的答案」。
当被要求为一个冷僻主题给出文献时,模型产出了三条引用——期刊名正确、作者名单逼真、标题貌似合理,连页码都有。可三篇里有两篇根本不存在。格式无懈可击;内容却是凭空捏造。已有数名律师,正因递交了这种伪造的引文而受到处分。
格式完美,内容捏造——这正是幻觉的标志。
「幻觉」这个词本身有点误导:模型并没有出故障,它做的恰恰正是它被造出来要做的事——生成说得通的文字。错位在于我们的期望,以为「说得通」就等于「真的」。幻觉无法被彻底清除;只能被减少、被察觉。