預訓練

自監督預訓練(self-supervised pretraining)

自監督預訓練指的是資料自己提供標籤。一般的監督式學習需要人去標註每個範例——這是貓、這則評論是正面的——既慢又昂貴。這裡的訣竅更單純:拿一段原始文本、把其中一部分藏起來,再請模型把藏起來的部分還原。答案本來就在文本裡,所以完全不需要人工標註。

對 LLM 來說,被藏起來的永遠是下一個詞元,可見的則是它前面的全部內容。文件中的每個位置都悄悄變成一個訓練範例:前文當輸入,緊接著的那個詞當正確答案。單單一個網頁就能免費產生數千組這樣的配對。正因如此,我們才得以在數兆詞元上訓練——否則世界上根本沒有那麼多人工標籤可用。

由於模型自始至終都只是在預測文本,它會學會任何有助於預測的規律:拼字、句法、世界知識,甚至粗略的推理。但它同樣會忠實地吸收資料中的偏見與錯誤,因為沒有任何東西告訴它哪些模式才是好的。

又称
self-supervisionlabel-free pretraining