大型語言模型是什麼

從自動完成到大型語言模型(autocomplete to LLM)

你手機上的自動完成,會根據你剛打的幾個字猜下一個字,例如打了「謝謝」就建議接「你」。大型語言模型其實是同一個點子推到極致。它不是只看前面三個字,而能看前面上千個字;靠的也不是一張常用片語的小表,而是數十億個參數,捕捉了相當於整個網路那麼多文字裡的規律。

規模改變了這件事的本質。手機的自動完成永遠只是把一個片語補完。但當模型能依據好幾頁的上下文來預測、又吸收了足夠多的文字,要把句子「接得好」有時就得回答一個問題、遵循一道指示,或寫出能跑的程式。機制始終是「預測下一個字」;只是能力一路長大,長到看起來不再像自動完成了。