侷限、幻覺與風險
大型語言模型為何會產生幻覺(why LLMs hallucinate)
根源在於訓練目標。模型靠著一遍又一遍預測下一個詞元來學習,回答越貼近訓練文本就越被獎勵。在這整個迴圈裡,沒有任何一個步驟在問「這是不是真的」。模型學會的是「聽起來像真話」的語言外型——它的節奏、它的用字、它篤定的語氣——卻沒有同時學到一張可靠、獨立的「哪些陳述真的成立」的地圖。真相與合理性,就這樣被攪和在一起。
還有兩股力量推波助瀾。模型沒有內建管道能表達「我不知道」,因為在訓練中「什麼都不說」很少是對的答案,於是它選擇把空缺填滿。而後續的對齊步驟可能會獎勵「討使用者歡心」的回答,這悄悄教會模型:一個流暢、聽起來樂於助人的猜測,勝過一個誠實的空白。合起來看,幻覺不是事後加裝的故障——它是這些系統被製造方式所投下的、直接的影子。
另见