推論與服務

多 token 預測(multi-token prediction)

標準語言模型只被訓練去預測緊接著的下一個 token,這讓推論時的生成嚴格地循序。多 token 預測改變了訓練目標,讓模型學會在每個位置一次預測接下來好幾個 token,做法是在共享的主幹上接一小組各自獨立的輸出頭。於是模型在每一步攜帶的,不只是對下一個字、還包含對其後幾個字的預測,且與主目標一同學成。

這達到兩個目的。作為訓練訊號,要求網路預期多個未來 token,會逼出更豐富的規劃與更長時程的表徵,已被證明能改善樣本效率與下游品質,在較大規模下對程式與推理尤其明顯。作為推論機制,這些額外的頭為自我推測提供現成的草稿 token:模型提出自己的延續、再用一次傳遞驗證,不需獨立草稿模型就能加速生成。於是同一組 MTP 頭在服務時兼任加速器。

它是推測解碼在訓練時的互補——與其事後再加裝起草機制,不如從一開始就教模型看往前好幾個 token。

多 token 預測是訓練目標,推測解碼是推論演算法。MTP 讓模型天生就好做推測,但這兩個想法位於堆疊的不同層次。

又称
MTP多 token 預測multi-token training objective