誠實的一段話總結
這裡是個平衡的觀點,濃縮在我們的能力與限制總覽裡。大型語言模型在以下這些事上是真的出色:流暢寫作、摘要、改寫、翻譯、草擬與解釋程式碼、發想,以及把雜亂的輸入整理成清楚的結構。而在這些事上則不可靠:精確的事實、最新的新聞、精準的算術,以及任何需要「保證正確」的事。把它們用好的本事,就在於知道你的任務落在哪一欄。
注意這個規律:大型語言模型在「語言形狀」的任務上閃閃發光——那種好答案有很多、流暢度很重要的任務;而在「精準形狀」的任務上則搖搖晃晃——那種只有一個正確答案、「差一點對」就等於「錯」的任務。光是這一個區別,就能預測它們大部分的行為。
它不是搜尋引擎
一個常見且代價高昂的錯誤,是把大型語言模型當成 Google。這個差別是根本性的,把大型語言模型與搜尋的對照放在腦中最前面是值得的。搜尋引擎會取回「真實、已存在」的文件,並把連結給你;而大型語言模型則是從它訓練資料裡的規律「生成」新的文字——即使它聽起來像在引用,它其實並沒有在引述某個存好的來源。
因此模型可能產生一段看起來完全真實、卻完全是它捏造出來的引用、引文或統計數字。凡是「來源很重要」的事——法律、醫療劑量、時事、特定數字——就用模型來草擬與思考,然後再對照一個真實、可取回的來源去查證。(現代工具越來越常把搜尋直接接到模型上,正是為了補上這個缺口。)
流程:查询从文档库检索资料,将其加入提示后再由大语言模型作答。
它為什麼會編造:幻覺
當大型語言模型以十足的自信陳述某件假的事,這就叫做幻覺(hallucination)。它直接源自這台機器的運作方式:它被訓練去產生「流暢、像樣」的接續,而「像樣」並不等於「為真」。如果它並不「知道」答案,它也沒有內建的本能會停下來——它仍然會生成那個聽起來最自然的補全,而那可能是一個自信滿滿的捏造。
每一个下一个词元都只按“看起来有多合理”来采样——这条规则里没有任何检查真假的环节,这正是流畅的回答仍可能是编造的原因。
「隨機鸚鵡」之辯
你會聽到有人把大型語言模型貶為隨機鸚鵡(stochastic parrot)——這個詞出自一篇著名的批評,主張這些模型只是把訓練資料裡的規律縫接在一起,並沒有任何真正的理解,就像鸚鵡複述牠並不懂的聲音。「隨機」(stochastic)不過是「帶有隨機性」的意思,指的正是你現在已經很懂的那種「一字一字、帶機率」的生成方式。
一个交互式马尔可夫链,通过在状态之间按概率转移来生成序列。
這個批評是否「完全」公允,是真的有爭議的:這些模型顯然不只是鸚鵡學舌——它們會推廣到新的組合;但它們同樣顯然缺乏對世界那種有根基的、具身的理解。你不必把這套哲學定論。實用的結論很穩固:在語言與點子上倚靠大型語言模型,在事實與精準上保持懷疑,凡是重要的決定都讓真人留在迴圈裡(human in the loop),你就能取得巨大的價值,同時避開最糟的陷阱。