推論與服務
前瞻解碼(lookahead decoding)
前瞻解碼完全不需要草稿模型或額外訓練的頭就能加速模型。它把自回歸生成重新表述成解一組方程式:不再嚴格地一個接一個產生 token,而是同時對好幾個未來位置做平行猜測並反覆修正,這是一種精神上類似 Jacobi 法的不動點迭代。每一步都把一個 token 視窗推近模型最終會落定的數值,從而打破平常讓解碼序列化的嚴格由左至右依賴。
具體上,它在每次前向傳遞裡跑兩條交錯的分支。前瞻分支從平行猜測中生成並蒐集短的 n-gram,把可信的延續累積成一個池子,作為迭代的副產品。驗證分支接著拿池中的候選 n-gram 去對照模型真正的下一個 token 分布,凡完全相符者就接受。隨著生成推進,n-gram 池越來越豐富、接受率上升,每一步免費得到的 token 也越多——而且可證明吐出的序列與貪婪解碼完全相同。
它的魅力是零訓練、零額外模型;代價是每一步算力更多,所以主要在 GPU 相對於記憶體頻寬還有餘裕浮點算力時才划算。
前瞻解碼是拿浮點算力換更少的循序步驟;它在記憶體受限的解碼上發光,但當 GPU 算力已飽和時可能反成淨損失。
又称
另见