建構大型語言模型應用與前沿
裝置端大型語言模型(on-device LLM)
多數 LLM 功能會去呼叫資料中心裡的伺服器,但一個夠小的模型,可以就在你手中的手機、筆電或車上跑。裝置端推論(on-device inference)的意思,是模型的權重住在那台裝置上、在本地生成文字,完全不必往返雲端。資料從不離開裝置、功能在離線時也能用,而且沒有按次計費的帳單。
要把一個能幹的模型塞進手機的幾 GB 記憶體裡,靠的是小型架構,加上積極的量化(quantization)——把權重用四位元甚至更少來儲存,而非十六位元——以及為裝置的 CPU、GPU 或專用神經加速器調校過的執行環境。框架載入壓縮後的模型、管理有限的記憶體,並在嚴苛的耗電與散熱預算內串流詞元。混合式設計很常見:裝置處理例行請求,再悄悄把最難的交給一個雲端模型。
在本地跑能換來隱私、離線可用、低延遲與零邊際成本——這對個人助理、輸入法,以及任何處理敏感資料的東西都很有吸引力。代價是能力:一個能塞進手機的模型,比前沿模型小得多,所以它推理較差、知道得也較少,而且還要和其他一切爭奪電池與記憶體。它的甜蜜點,是界定良好、對延遲或隱私敏感的任務,而非開放式的通用智慧。
又称
另见