推論與服務
自我推測解碼(self-speculative decoding)
自我推測解碼用單一個模型就取得推測解碼的好處,既不需獨立的草稿網路、也不需額外訓練的頭。它的點子是用模型自己被刻意弱化的版本來起草——通常是只跑它最前面幾層、跳過其餘——產生快速而近似的 token。接著同一個完整模型用一次完整的前向傳遞驗證這些草稿 token,接受它同意的前綴,做法與標準推測完全相同,因此輸出分布不變。
由於草稿與目標共享全部權重,起草只花最前面那幾層的算力,並重用同一份 KV 快取與記憶體,從而繞開託管兩個模型的部署負擔。像 LayerSkip 這類方法會訓練網路使其對丟棄後段層具魯棒性、並能提早離開,讓它的淺層子網路本身就是個稱職的起草者;驗證時則只對候選 token 跑剩餘的層。整套方案塞得進單一模型的記憶體足跡裡。
它拿接受率的小幅下降——因為部分模型起草不如專用模型精準——換取「沒有任何額外東西要部署」的簡潔。
Medusa 加頭、EAGLE 加特徵起草器、自我推測重用模型自己的淺層——三條不需第二個完整模型就能起草的路。
又稱
另見