所以,大型語言模型到底是什麼?
大型語言模型(large language model,LLM)的核心,就是一個「吃進一段文字、再產生更多文字」的電腦程式。你打一個問題、一個請求,或一個故事的開頭,它就會寫出一段讀起來像是由懂行的人所寫的接續內容。整個工作說明就只有這樣。大型語言模型所有令人驚豔的本領——回答問題、草擬電子郵件、解釋程式碼、翻譯——其實都是同一種能力:寫出像樣的文字,只是被用在不同任務上。
更精確地說,大型語言模型是一種生成式文字模型(generative text model):說它「生成式」(generative),是因為它會創造新的文字,而不只是把文字分類或評分;說它「文字」,是因為它從頭到尾處理的就是「文字進、文字出」。它並沒有一個可供查詢的答案資料庫,而是根據從海量文章裡吸收到的規律,一小段一小段地、當場重新產生每一次的回應。
你早就見過它的小表親了
當你打字時,手機鍵盤替你預測下一個字——你打「我五分鐘後到」,它就跳出「分鐘」——你看到的就是同一個想法的嬰兒版。這正是從自動完成到大型語言模型故事的核心:大型語言模型就是被放大到幾乎認不出來的自動完成,餵進多得多的文字,並配上強得多的「大腦」。
從手機自動完成跨到一個好用的助理,落差固然巨大,但「正在發生的那種事」其實是一樣的:看看目前為止的文字,預測接下來會是什麼。請記住這個畫面,它是整個領域裡最有用的一個直覺,下一篇導覽會把它完整拆開來談。
一句話概括核心思想:給定目前為止的文字,模型為每一個可能的下一個詞分配一個機率。
為什麼叫「大型」?
「大型」這個詞指向兩種「大」。第一,模型內部有龐大數量、可調整的「旋鈕」,稱為參數(parameters)——往往是數百億甚至上千億個。這些數字會在學習過程中被調整,並儲存了模型對「語言如何運作」所「知道」的一切。第二,它從巨量的訓練資料(training data)中學習:人類放上網的書籍、文章與網頁中的很大一部分。
把這兩者加起來——大量參數加上大量資料——你得到的系統,等於是把人類書寫的一大塊內容裡的規律,提煉進了單一程式裡。正是這種規模,讓一台單純「預測下一個字」的機器最終能做這麼多事。它是把語言模型(language model)這個概念推到極致的一種樣貌,因此人們也直接稱它為大型語言模型,並把它當成一個獨立的主題來研究。
對數座標圖顯示損失隨模型與資料規模擴大而穩步下降。
用起來是什麼感覺
實際使用時,你打開一個聊天框,用日常語言輸入,再用日常語言得到答案。沒有要學的特殊語法。你可以追問、貼上一段文字請它摘要,或說「請當我是十二歲的小孩來解釋」。模型會把你整則訊息當成「要合理接續下去的文字」來處理。
- 你輸入一則訊息——一個問題、一項任務,或一段要處理的文字。
- 模型讀取目前為止的一切,包括對話前面幾輪的內容。
- 它一次次預測「最貼切的下一段文字」,藉此寫出回覆。
- 你讀完後再調整你的請求,這個循環就以對話的形式持續下去。
這個系列接下來要去哪裡
這第一個系列會停留在「清楚的直覺」這個層次——不用數學,也沒有你無法想像的術語。接下來的四篇導覽,我們會看到那個核心想法(預測下一個字)、一個原始的預測器如何變成有禮貌的聊天機器人、模型裡面到底有什麼,以及對大型語言模型「擅長什麼、又在哪裡失手」的誠實盤點。讀完之後,你會擁有一個穩固的心智模型,而領域其餘部分——詞元、注意力、訓練、提示——都建立在它之上。