高效與邊緣人工智慧

詞元合併(ToMe)

Transformer 的成本隨詞元數量增長,但許多詞元是冗餘的——看起來相似的相鄰影像區塊,或重複的文字。詞元合併在詞元通過網路時,把相似的合併成一個,縮短序列、同時削減注意力與 MLP 的成本;在僅推論的形式下,它完全不需要重新訓練。

ToMe 在每個區塊的注意力與 MLP 之間插入一個步驟:它用注意力鍵的餘弦相似度衡量詞元相似性,以快速的二分軟匹配把最相似的詞元配對,再把每一對平均成單一的合併詞元,使數量在每層固定減少 r 個。一個大小權重讓每個合併詞元在後續注意力中保持成比例的影響力。對分割等稠密輸出,這些合併可以在最後再拆開。

詞元合併在視覺 Transformer 與擴散模型中收益最大,能以很小的品質損失換得可觀的加速。在語言模型中,它與剪枝及 KV 快取壓縮有所重疊,且必須遵守因果遮罩與位置結構,因此在那裡套用得更為謹慎。

又称
ToMetoken merging詞元合併