現代大型語言模型架構內部
專家負載平衡(expert load balancing)
放著不管,路由器往往會偏心:少數幾位專家拿到大部分詞元而越練越強,其餘的卻挨餓、永遠進步不了,白白浪費了參數。這種塌縮是專家混合訓練的核心失敗模式。負載平衡就是一組壓力,讓流量分散到所有專家身上,好讓每位專科都得到足夠練習而變得有用。
常用工具是訓練時額外加上的輔助損失,懲罰不均勻的路由,把每位專家收到的詞元比例推向相等。硬體又給了第二個要平衡的理由:專家分散在許多裝置上,最慢、最過載的裝置決定整體速度,所以一旦某位專家滿了,詞元容量上限就會丟棄或改路由溢出的部分。較新的做法改用專家選擇路由或偏置項,而非沉重的輔助損失,因為那個損失若推得太用力,本身也會傷害品質。
又称
另见