高效與邊緣人工智慧

裝置端推論

裝置端推論讓模型直接在使用者面前的手機、手錶、汽車或微控制器上執行,而不把資料送往伺服器。好處是隱私——資料從不離開裝置——再加上離線可用與低且可預測的延遲。代價則是記憶體、運算、能耗與散熱上的硬性上限。

要塞進那份預算,得把本領域的技術——低位元量化、剪枝、蒸餾、高效架構——與針對行動 NPU、DSP 與 GPU 的硬體專屬執行環境結合,例如 Core ML、LiteRT、ONNX Runtime、llama.cpp 與 ExecuTorch。對 Transformer 解碼而言,約束通常是記憶體頻寬而非原始浮點運算量,所以權重量化與 KV 快取管理主導了實際效能,而熱節流則限制了持續吞吐量。

這個領域正穩步地把十億級參數的語言模型搬上消費級硬體,但工程毫不留情:一個在單次基準測試中看似良好的模型,一旦裝置升溫、省電模式啟動或作業系統回收其記憶體,仍可能卡頓。

裝置端的關鍵限制通常是記憶體頻寬與能耗,而非峰值 TOPS——晶片標榜的運算數字很少能預測真實延遲。

又稱
on-device inferenceedge inference裝置端推論