Transformer 與大型語言模型內部機制

稀疏專家混合(sparse MoE)

稀疏專家混合把 transformer 的單一前饋區塊換成許多平行的前饋專家,再加一個小型路由器,把每個 token 只送給其中少數幾個。模型擁有龐大的參數池,但任一 token 只啟動薄薄一片。這讓參數量與計算量解耦:你可以把容量擴大 10 倍,而每個 token 的浮點運算量幾乎不變。

一個閘控網路對 E 個專家產生分數;選出 top-k(常為 k 等於 2),其輸出以對所選分數做 softmax 的權重組合。由於每個 token 只跑 E 中的 k 個前饋,計算量隨 k 而非 E 增長。訓練需要一個負載平衡輔助損失,以免路由器塌縮到少數專家,再加上容量上限——當某專家的緩衝溢出時丟棄或改路由 token。稀疏性使梯度只流經被選中的專家,這既壓低成本,也讓最佳化變得更棘手。

稀疏 MoE 支撐了 Mixtral 等模型,也據稱支撐 GPT-4 等級系統,在每單位訓練浮點運算上給出強勁品質。實務成本是記憶體(所有專家都必須儲存並跨裝置分片)、token 路由的全對全通訊,以及對負載不均的敏感。

又稱
sparse MoESMoE稀疏專家混合