Transformer 與大型語言模型內部機制
Switch Transformer
Switch Transformer 是把路由推到最簡極端的專家混合模型:每個 token 只去「恰好一個」專家(top-1),而非兩個以上。作者證明這種 top-1 開關路由足以穩定地訓練極大的稀疏模型——擴展到超過一兆參數——同時把每個 token 的計算維持在單一前饋區塊的量級。
top-1 路由相較 top-2 把路由的計算與通訊減半、也簡化閘控,但使負載平衡變得脆弱,因此設計倚賴三項要素:一個負載平衡輔助損失、一個專家容量因子來限制每個專家接受多少 token(超額的 token 經殘差連接被丟棄),以及選擇性地使用 bfloat16/float32 精度以維持路由器的數值穩定。它也把 MoE 重新詮釋為以記憶體換取樣本效率的途徑,回報在同等品質下預訓練實際時間大幅加速。
Switch Transformer 是讓稀疏 MoE 對語言模型變得實用且流行的工作,奠定了 top-1 路由、容量因子與平衡損失這套標準工具,後由 GShard、Mixtral 與專家選擇路由(expert-choice routing)進一步精煉。它更廣的主張是一個擴展論證:當你記憶體充裕卻受計算所限時,加入稀疏參數比加深或加寬更便宜地買到品質,因為對任一 token 而言,那些參數大多閒置。這個重新框定——參數很便宜、且只被選擇性地啟動——正是其後每一個大型 MoE 語言模型的概念種子。
又称
另见