自然語言處理

大型語言模型(large language model)

/ larj LANG-gwij MOD-uhl /

大型語言模型是一張龐大的數字之網,靠一個簡單的遊戲訓練出來:讀一段文字,猜下一個詞。把這個遊戲在人類寫下的海量內容上反覆玩——書籍、程式碼、對話、整個開放網路——模型便慢慢學會了語言的規律。它有點像手機上的輸入法聯想,只是規模大到驚人,於是它不再只是補完一句話,而能寫出整篇文章、翻譯一首詩,或講解一道菜譜。

在它的內部,是一種叫做「變換器」(transformer)的架構,其核心絕招叫「注意力」:閱讀時,模型會權衡前面哪些詞對猜測下一個詞最重要,從而在長段落裡把握住意義。憑著數十億個可調的旋鈕和海量的訓練文本,它建立起一張關於詞與詞如何關聯的豐富內部地圖。

真正讓這類模型了不起的,是一個意外之喜:沒有人手工把語法、事實或推理寫進去。一旦模型與訓練規模足夠大,這些能力便自行「湧現」——規模的躍升帶來能力的躍升。一個常見的誤解,是以為模型在「查資料」或真的「懂了」;其實它只是在預測看似合理的詞。這也是為什麼它可能口氣篤定卻答錯——人們把這種失誤稱為「幻覺」。

給定「那隻貓坐在___上」,模型給「墊子」很高的機率,給「屋頂」較低的機率,給「民主」極小的機率——再從這個分佈中挑選。

是預測,而非記憶調取:大型語言模型刻畫的是下一個詞元的機率。

這一突破可追溯到 2017 年的論文《Attention Is All You Need》,它提出了變換器架構;名字裡的「大」指的純粹是規模——參數量與訓練資料之多。「GPT」是 OpenAI 旗下模型的名字,意為「生成式預訓練變換器」,它只是大型語言模型中一個廣為人知的家族——許多領先的模型,如 Gemini、Claude、LLaMA,並不是 GPT。

又稱
LLM大语言模型大型語言模型foundation model基础模型基礎模型