裡面有什麼:參數
把大型語言模型打開來看,你不會找到規則、句子或知識庫,而會找到一大片數字的網格,稱為參數(parameters)——也直接叫做權重(weights)。每一個都是單一數值,像是 0.0123 或 -1.84,而一個大模型在一張神經網路(neural network)裡排了數十億個這樣的數字。當模型處理你的文字時,它讓一波又一波的乘法與加法流過這些數字;這串算術的輸出,就是被預測出來的下一個字。
一张多层网络示意图,节点的各层之间有带权重的连线。
那麼「知識」在哪?它被抹散在那數十億個參數之中。並沒有哪一個數字專門對應「巴黎」或「重力」。事實、文法與風格,是以分散的規律存在於整片網格裡——這就是為什麼你沒辦法直接打開檔案去改掉一個事實,也是為什麼模型能把它從沒被明確教過的概念融合起來。
知識從何而來:訓練資料
這些參數一開始是隨機雜訊。它們透過預訓練(pretraining)變得有用:模型被餵進巨量的訓練資料——網頁、書籍、程式碼、文章——並在每一個位置被要求預測下一個字。每當它猜錯,參數就被輕輕推一下,好讓下次錯得少一點。把這件事重複上兆次,那片隨機的網格就慢慢變成了一個「人類文字如何運作」的模型。
训练循环:数据进入模型,模型作出预测,用损失与目标比较,然后更新参数。
一個模型,一千種工作
正因為它從如此廣泛的文字裡學習,單一個大型語言模型,就是一個通用語言模型(general-purpose language model):同一組參數,可以翻譯、摘要、寫程式、發想、解說——而不需要為每項任務重建一次。這和舊式軟體是一個真正的斷裂:在舊式軟體裡,每一個問題你都得要一支獨立、為它量身打造的程式。
這種通用性,正是人們把大型預訓練模型稱為基礎模型(foundation model)的原因:一個廣泛勝任的單一底座,無數應用再疊在它之上建構。同一個底座,可以驅動一個寫程式助手、一個客服機器人,以及一個寫作工具,每一個都只需要輕度的調整。
開放權重對封閉
模型彼此之間,在「你被允許怎麼取得它」這點上也有差別。對一個開放權重(open-weight)模型而言,訓練好的參數會被公開,因此你可以下載它們、在自己的機器上執行模型、檢視它,並自由地微調它。對一個封閉(closed)模型而言,權重被保密,你只能透過一個線上服務(API)接觸到模型,通常按使用量付費。
- 開放權重:完全掌控、可離線執行、可客製化,但硬體與專業知識得你自己出。
- 封閉:最容易上手、通常能力最強,但你得仰賴供應商,並把資料送給他們。
- 兩者都不是單純地「比較好」——正確的選擇取決於隱私需求、預算、掌控度與技術能力。