現代大型語言模型架構內部

權重綁定與規模選擇(weight tying and scaling)

權重綁定是模型兩端的一個節儉小技巧。輸入嵌入把每個詞元編號轉成向量;輸出層再把向量轉回對整個詞彙表的分數。這兩者互為鏡像,所以許多模型讓它們共用同一個矩陣,省下一大塊參數,且常常還提升品質,因為同一個詞進來與出去都落在同一個點上。不過對非常大的詞彙表,一些近期模型會讓它們不綁定。

規模選擇是更廣的問題:在固定的參數預算下,要花在更多層(深度)還是更寬的層(寬度),以及它們該如何隨模型大小成長。擴展律提供經驗性的指引,顯示損失會隨參數、資料與計算一起成長而可預測地下降,並警告一個資料不足的大模型是浪費。網路的形狀,它的寬深比與注意力頭數,會與這些定律一起調校,好讓模型訓練穩定且善用預算。

又稱
tied embeddingswidth vs. depth