預訓練
因果語言建模(causal language modeling)
因果語言建模指的是模型嚴格地由左往右讀,只能看見前面出現過的詞,永遠看不到後面的詞。想像你用手蓋住一頁文字,每次向右滑開一個詞,並根據已露出的內容預測下一個新詞。「因果」二字正捕捉了這種單向流動:過去能影響下一個詞元,未來則是隱形的。
在機制上,注意力層裡有一個遮罩,阻止每個位置去注意更後面的位置,因此第 t 個詞元的預測只依賴第 1 到 t-1 個詞元。訓練時整個序列仍是平行處理的,但遮罩保證了不會偷看後文。正是這個設定讓訓練好的模型能夠生成:給它一段提示,它就一次一個詞元地把它續寫下去。
它與遮罩語言建模(如 BERT)形成對比——後者隨機藏住一些詞,讓模型同時利用左右兩側的脈絡。因果模型放棄了這種雙向視野,換來流暢續寫的能力——這也是為什麼幾乎每個生成式 LLM 都是因果模型。
又称
另见