現代大型語言模型架構內部
純解碼器架構(decoder-only architecture)
想像一位作家只能讀到目前這個詞之前的內容,永遠看不到後面,而他唯一的工作就是猜下一個詞。純解碼器模型就是依這個方式串接起來的一疊相同的 transformer 區塊:每個詞元只關注它自己與更早的詞元,從不看向未來。用海量語料訓練它去預測下一個詞元,同一台機器就學會了聊天、摘要、翻譯與寫程式,因為這些其實都只是某段文字的延續。
最初的 transformer 有兩半,一個編碼器一次讀完整段輸入,一個解碼器負責寫出輸出。現代大型語言模型丟掉了編碼器以及兩者之間的交叉注意力,只保留帶遮罩的解碼器堆疊。每個區塊先做因果自注意力,再過一個前饋網路,兩者外面都包著殘差連接與正規化。這個單一設計能乾淨地擴大規模,讀與寫共用同一組權重,並把每個任務都化為同一個一致的問題:給定這段前綴,接下來是什麼。
編碼器-解碼器與純編碼器設計在翻譯與檢索上仍有用,但今天幾乎所有通用聊天型大型語言模型都是純解碼器。
又稱
另見