JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

不碰數學看引擎蓋下:參數、資料、開放與封閉

大型語言模型裡面到底有什麼、它的知識從哪裡來、為什麼一個模型能勝任上千種工作,以及「開放」或「封閉」的模型各是什麼意思。

裡面有什麼:參數

把大型語言模型打開來看,你不會找到規則、句子或知識庫,而會找到一大片數字的網格,稱為參數(parameters)——也直接叫做權重(weights)。每一個都是單一數值,像是 0.0123 或 -1.84,而一個大模型在一張神經網路(neural network)裡排了數十億個這樣的數字。當模型處理你的文字時,它讓一波又一波的乘法與加法流過這些數字;這串算術的輸出,就是被預測出來的下一個字。

LLM 的「參數」其實就是網路連接上的權重——數十億個數字,而不是規則。

一張多層網路示意圖,節點的各層之間有帶權重的連線。

那麼「知識」在哪?它被抹散在那數十億個參數之中。並沒有哪一個數字專門對應「巴黎」或「重力」。事實、文法與風格,是以分散的規律存在於整片網格裡——這就是為什麼你沒辦法直接打開檔案去改掉一個事實,也是為什麼模型能把它從沒被明確教過的概念融合起來。

知識從何而來:訓練資料

這些參數一開始是隨機雜訊。它們透過預訓練(pretraining)變得有用:模型被餵進巨量的訓練資料——網頁、書籍、程式碼、文章——並在每一個位置被要求預測下一個字。每當它猜錯,參數就被輕輕推一下,好讓下次錯得少一點。把這件事重複上兆次,那片隨機的網格就慢慢變成了一個「人類文字如何運作」的模型。

預訓練就是把這個迴圈放到極大規模上運行:預測下一個詞、衡量誤差、微調參數——在數十億個樣本上反覆進行。

訓練迴圈:資料進入模型,模型作出預測,用損失與目標比較,然後更新參數。

一個模型,一千種工作

正因為它從如此廣泛的文字裡學習,單一個大型語言模型,就是一個通用語言模型(general-purpose language model):同一組參數,可以翻譯、摘要、寫程式、發想、解說——而不需要為每項任務重建一次。這和舊式軟體是一個真正的斷裂:在舊式軟體裡,每一個問題你都得要一支獨立、為它量身打造的程式。

這種通用性,正是人們把大型預訓練模型稱為基礎模型(foundation model)的原因:一個廣泛勝任的單一底座,無數應用再疊在它之上建構。同一個底座,可以驅動一個寫程式助手、一個客服機器人,以及一個寫作工具,每一個都只需要輕度的調整。

開放權重對封閉

模型彼此之間,在「你被允許怎麼取得它」這點上也有差別。對一個開放權重(open-weight)模型而言,訓練好的參數會被公開,因此你可以下載它們、在自己的機器上執行模型、檢視它,並自由地微調它。對一個封閉(closed)模型而言,權重被保密,你只能透過一個線上服務(API)接觸到模型,通常按使用量付費。

  1. 開放權重:完全掌控、可離線執行、可客製化,但硬體與專業知識得你自己出。
  2. 封閉:最容易上手、通常能力最強,但你得仰賴供應商,並把資料送給他們。
  3. 兩者都不是單純地「比較好」——正確的選擇取決於隱私需求、預算、掌控度與技術能力。