大型語言模型是什麼

通用語言模型(general-purpose language model)

在大型語言模型出現之前,你通常得為每一項任務各建一個模型:翻譯一個、垃圾郵件偵測一個、情緒分析又一個。通用語言模型把這些通通併成一個。同一個模型能翻譯、能摘要、能寫程式、能回答問題、能腦力激盪,差別只在於你用日常語言「換個方式問」。你換的是提示,不是模型。

這之所以行得通,是因為這些任務都能寫成「輸入文字、輸出文字」的形式,而一個在語言上訓練得夠廣的模型,已經見過每一類的規律。只憑指示就能切換任務、完全不必重新訓練,這種本事叫「上下文學習(in-context learning)」,正是它讓單一模型成為通用工具的原因。反過來說,樣樣通的通才,在任何一個又窄又專的任務上,幾乎都不會是最頂尖的那個。