幻覺(hallucination)
/ huh-loo-suh-NAY-shun /
幻覺,是指語言模型用「它陳述真事時一樣的鎮定與自信」,說出某件不實、捏造、或毫無依據之事。它會編出一樁聽上去言之鑿鑿、卻從未發生過的官司,引用一篇作者煞有介事、標題卻是假的研究,或信心十足地把一個日期記錯。要命的是,它絲毫不流露半點猶疑——那條編造的「事實」,與一條正確的,是用同一副流暢、權威的口吻送到你面前的,而這恰恰正是幻覺危險之所在。
之所以會這樣,是因為它深植於模型的運作方式之中。語言模型被訓練去產出「在前文之下統計上說得通」的文字——而非「經過現實核實」的文字。它沒有一座可供查對的獨立事實庫,也沒有一種與生俱來的「這個我其實不知道」的自覺。當它缺了真正的答案,最「說得通」的續寫,往往就是一個自信、規整的猜測。模型並不是在「撒謊」——撒謊需要先知道真相、再選擇隱瞞;模型只是在生成可能的詞,而有時,可能的詞恰好是錯的。
這不是一個未來某次更新會悄悄修好的小毛病;它是「訓練模型去預測說得通的文字」這件事的根本後果。一些技術有幫助——檢索增強生成把答案錨定在真實文件上,要求給出出處、或讓它表達不確定,也能減少它——但沒有什麼能將它根除。實用的結論雖不光鮮,卻至關重要:凡是要緊的事,請把模型那個自信的事實性斷言,當作一條「有待核實的線索」,而非一個「可以信賴的答案」。
當被要求為一個冷僻主題給出文獻時,模型產出了三條引用——期刊名正確、作者名單逼真、標題貌似合理,連頁碼都有。可三篇裡有兩篇根本不存在。格式無懈可擊;內容卻是憑空捏造。已有數名律師,正因遞交了這種偽造的引文而受到處分。
格式完美,內容捏造——這正是幻覺的標誌。
「幻覺」這個詞本身有點誤導:模型並沒有出故障,它做的恰恰正是它被造出來要做的事——生成說得通的文字。錯位在於我們的期望,以為「說得通」就等於「真的」。幻覺無法被徹底清除;只能被減少、被察覺。