推論與服務部署
每詞元成本(cost per token)
在規模化之後,決定一個功能能不能上線的問題很白:一個詞元要花多少錢?供應商以每百萬詞元報價,通常把較便宜的輸入(預填充)詞元和較貴的輸出(解碼)詞元分開計,因為這兩個階段對硬體施加的壓力方式完全不同。
底層成本就是硬體時間:GPU 每小時的成本除以系統能持續維持的每秒詞元數。所以任何能拉高持續吞吐量的手段——連續批次、量化、推測解碼、更大的批次、前綴快取——都直接降低每詞元成本。輸出詞元比較貴,是因為記憶體受限的解碼一次只生一個,而預填充是平行地嚼完輸入詞元。這個單一數字把整個服務堆疊綁到生意上:它訂出 API 價格、決定哪些用途划算,也正是為什麼那麼多工程心力都用在從每一張 GPU 擠出更多詞元。
另见