JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

大型語言模型做得到與做不到的事(目前為止)

一張誠實的地圖,標出它的強項與失靈之處——包括為什麼大型語言模型不是搜尋引擎,以及「隨機鸚鵡」這個批評真正想說的是什麼。

誠實的一段話總結

這裡是個平衡的觀點,濃縮在我們的能力與限制總覽裡。大型語言模型在以下這些事上是真的出色:流暢寫作、摘要、改寫、翻譯、草擬與解釋程式碼、發想,以及把雜亂的輸入整理成清楚的結構。而在這些事上則不可靠:精確的事實、最新的新聞、精準的算術,以及任何需要「保證正確」的事。把它們用好的本事,就在於知道你的任務落在哪一欄。

注意這個規律:大型語言模型在「語言形狀」的任務上閃閃發光——那種好答案有很多、流暢度很重要的任務;而在「精準形狀」的任務上則搖搖晃晃——那種只有一個正確答案、「差一點對」就等於「錯」的任務。光是這一個區別,就能預測它們大部分的行為。

它不是搜尋引擎

一個常見且代價高昂的錯誤,是把大型語言模型當成 Google。這個差別是根本性的,把大型語言模型與搜尋的對照放在腦中最前面是值得的。搜尋引擎會取回「真實、已存在」的文件,並把連結給你;而大型語言模型則是從它訓練資料裡的規律「生成」新的文字——即使它聽起來像在引用,它其實並沒有在引述某個存好的來源。

因此模型可能產生一段看起來完全真實、卻完全是它捏造出來的引用、引文或統計數字。凡是「來源很重要」的事——法律、醫療劑量、時事、特定數字——就用模型來草擬與思考,然後再對照一個真實、可取回的來源去查證。(現代工具越來越常把搜尋直接接到模型上,正是為了補上這個缺口。)

检索增强生成让模型基于真实来源作答——这正是把大语言模型当搜索引擎时的补救之道。

流程:查询从文档库检索资料,将其加入提示后再由大语言模型作答。

它為什麼會編造:幻覺

當大型語言模型以十足的自信陳述某件假的事,這就叫做幻覺(hallucination)。它直接源自這台機器的運作方式:它被訓練去產生「流暢、像樣」的接續,而「像樣」並不等於「為真」。如果它並不「知道」答案,它也沒有內建的本能會停下來——它仍然會生成那個聽起來最自然的補全,而那可能是一個自信滿滿的捏造。

x_t \sim p_\theta\!\left(x_t \mid x_{<t}\right)

每一个下一个词元都只按“看起来有多合理”来采样——这条规则里没有任何检查真假的环节,这正是流畅的回答仍可能是编造的原因。

「隨機鸚鵡」之辯

你會聽到有人把大型語言模型貶為隨機鸚鵡(stochastic parrot)——這個詞出自一篇著名的批評,主張這些模型只是把訓練資料裡的規律縫接在一起,並沒有任何真正的理解,就像鸚鵡複述牠並不懂的聲音。「隨機」(stochastic)不過是「帶有隨機性」的意思,指的正是你現在已經很懂的那種「一字一字、帶機率」的生成方式。

就像这条马尔可夫链,大语言模型靠概率把看似合理的模式拼接起来——这正是“随机鹦鹉”批评中那一点道理所在。

一个交互式马尔可夫链,通过在状态之间按概率转移来生成序列。

這個批評是否「完全」公允,是真的有爭議的:這些模型顯然不只是鸚鵡學舌——它們會推廣到新的組合;但它們同樣顯然缺乏對世界那種有根基的、具身的理解。你不必把這套哲學定論。實用的結論很穩固:在語言與點子上倚靠大型語言模型,在事實與精準上保持懷疑,凡是重要的決定都讓真人留在迴圈裡(human in the loop),你就能取得巨大的價值,同時避開最糟的陷阱。