現代大型語言模型架構內部
專家混合(mixture of experts,MoE)
稠密模型讓每個詞元都通過同一個巨大的前饋層,所以要讓模型更聰明就得把那一層加大,而每個詞元都得付全額帳單。專家混合把一個大前饋區塊換成許多較小的專家區塊,外加一個路由器,為每個詞元只挑出其中一兩個來運算。可以想像一間醫院,櫃檯把每位病患轉給兩位相關專科醫師,而不是讓每個人都看遍所有醫師。
這讓總參數量得以巨幅成長,而每個詞元所做的運算量卻維持很小,因為只有被選中的專家會啟動。一個模型可能擁有六十四位專家,卻只把每個詞元路由給其中兩位,於是它以小網路的計算成本承載了龐大網路的知識。代價是所有專家仍都駐留在記憶體中,路由器必須被訓練得會做好選擇,而要讓專家被平均使用還得特別費心——接下來幾個詞條會逐一拆解。
又稱
另見