高效與邊緣人工智慧
深度混合(MoD)
標準的 Transformer 在每一層、對每個詞元都花費相同的運算,即使許多詞元只是簡單的連接詞。深度混合讓每一層只處理選定的詞元子集,其餘的則透過殘差連接直接略過,於是模型把運算花在真正需要的地方。
每個區塊都有一個輕量的路由器替詞元評分,並在固定的容量下——例如序列前 12.5%——選出哪些詞元進入「注意力加 MLP」的運算;未被選中的詞元則原封不動地繞過。由於容量是靜態的,每層的浮點運算量事先即知,這與依資料而定的提前退出不同。路由器與模型一起訓練,並透過輔助預測器或專家選擇式的選法,讓 top-k 決策在推論時仍能因果地使用。
MoD 借用了專家混合的路由想法,但它是沿深度路由,而非在平行的專家之間路由。結果是一個模型能以更少的浮點運算達到相同的損失,或在相同參數量下跑得更快——方法就是對不需要的詞元,乾脆不去計算那些層。
又稱
另見