推論與服務

EAGLE 推測解碼(EAGLE speculative decoding)

EAGLE 透過「在正確的空間裡起草」來磨利推測解碼。早期的草稿模型猜的是離散又嘈雜的原始 token,因此接受率不佳。EAGLE 改為預測目標模型自己倒數第二層的特徵向量——也就是輸出投影之前那層平滑、連續的隱藏狀態——再把它們映射成 token。預測特徵是比預測 token 更容易的迴歸問題,因為特徵的軌跡在自回歸意義下更可預測,於是帶來明顯更高的接受率。

它的草稿是單一個小的自回歸頭,同時吃進前一個特徵與前一個被採樣的 token 作為輸入,藉此解掉純特徵預測在下一個 token 真正模稜兩可時會留下的不確定性。它把好幾條候選延續展開成一棵樹,目標模型一次傳遞驗證整棵樹,做法與樹狀推測完全相同,使輸出分布與目標模型一致。後續版本還加入動態草稿樹,其形狀會隨每一步的信心調整。

在無損加速器之中,EAGLE 達到了已知最高的加速比之一,常達三倍以上,這也是為什麼它在開源服務框架中成了常見的預設草稿頭。

EAGLE 的洞見是「特徵比 token 更好預測」;把被採樣的 token 連同特徵一起餵入,正是用來處理純特徵起草會漏掉的模稜兩可。

又稱
EAGLEfeature-level speculationEAGLE 推測解碼