推論與服務部署
大型語言模型推論(LLM inference)
訓練是教模型,推論則是使用模型。當你輸入提示、模型回寫文字時,那就是推論——讓資料一次次穿過數十億個凍結的權重,每產生一個輸出詞元就重複一次前向傳播。這裡不會發生學習:權重永遠不變,每個使用者的請求都只是讀取同一個訓練好的網路。
具體來說,模型先讀完你的整段提示,然後一次只產生一個詞元。每個新詞元都從詞彙表上的機率分布抽樣而來,接到目前文字後面,再餵回去預測下一個——這就是自迴歸迴圈。正因如此,較長的回答要花上很多次前向傳播,也因此真正主宰已部署模型日常算力帳單的是推論而非訓練,大部分服務工程也都投入於此。
又稱
另見