現代大型語言模型架構內部
稀疏與稠密模型(sparse vs. dense)
稠密與稀疏描述的是每個詞元實際喚醒了網路的多少部分。在稠密模型裡,每個參數都參與每個詞元,所以你儲存的參數與你花掉的計算是同一個數字。在稀疏模型裡——幾乎總是專家混合——每個詞元只點燃一小片參數,於是模型能容納的總參數遠多於它一次真正運行的量。
實務上的分野在於兩種預算:總參數,大致對應模型能知道多少;以及活躍參數,對應每個詞元的成本。稀疏模型把兩者解耦,用遠超其計算量的代價買到知識容量。代價是記憶體,因為每位專家即使大多閒置也都得被儲存與搬移,再加上路由與平衡的機制。在兩者間取捨,其實是在選擇你的瓶頸究竟是計算還是記憶體。
又称
另见