現代大型語言模型架構內部
專家路由(MoE routing)
路由器是決定每個詞元造訪哪些專家的小腦袋。對一個詞元的隱藏向量,它為每位專家算出一個分數,通常用一個線性層接 softmax,然後保留分數最高的少數幾位專家,常是最高的一兩位。被選中的專家會運算,其輸出再依路由器分數的比例混合。所以路由不過是一個學得的、逐詞元的查表,告訴系統此刻要把這個特定的詞送到哪裡。
棘手之處在於這個選擇是離散的,你要嘛選一位專家、要嘛不選,並非平滑可微。訓練時繞過這點的方式,是讓梯度只流過實際被選中專家的軟分數,於是路由器漸漸學會把像程式碼的詞元送給某位專家、把標點送給另一位。兩種常見風格是詞元選擇,每個詞元抓取自己偏好的專家;以及專家選擇,每位專家抓取自己偏好的詞元,後者有助於維持負載均衡。
由於路由是離散的,top-k 決策不可微;梯度只流經實際被選中專家的軟權重。
又稱
另見