推論與服務部署
僅權重量化(weight-only quantization)
模型裡不是每樣東西都需要縮小。在記憶體受限的解碼裡,昂貴的是讀權重,相比之下流過的激活值小得多。僅權重量化只把權重壓到四或八位元,讓真正的算術仍以較高精度運行。
權重以低位元整數儲存;在運算當下,每個權重或每一塊權重會即時反量化回 fp16 或 bf16,矩陣乘法就以那個較高精度進行。因為瓶頸本來就在記憶體流量,你照樣拿到速度與容量上的好處,而把激活值留在十六位元,又避開了量化那些變動劇烈、容易出現離群值的激活所帶來的準確度陷阱。GPTQ 與 AWQ 之類的方法會謹慎挑選整數網格——例如 AWQ 會保護那些與最顯著激活相連的權重——以便即使在 int4 也守住品質。
與權重加激活量化(例如 int8 GEMM)相對:後者兩邊都量化以跑整數運算,但更難維持準確度。
另见