高效與邊緣人工智慧

AWQ(激活感知權重量化)

並非所有權重都同等重要。AWQ 觀察到,只有一小部分權重通道——也就是會與大幅度激活值相乘的那些——承載了模型大部分的品質,而只要保護其中約前百分之一的這些顯著通道,就幾乎能挽回低位元量化所損失的全部精度。

把那些通道保留在較高精度會破壞硬體核心,因此 AWQ 改為在量化權重前,先以每通道的縮放因子 s 放大每個輸入通道,並把激活值除以同一個 s——這是一個讓乘積不變的精確重新參數化。依各通道激活值的平均幅度,從一個小格點集合中挑選 s,便能縮小顯著通道上的相對量化誤差。整個搜尋只用到小型校準集上的前向傳播,不需反向傳播,也不需二階海森矩陣。

AWQ 提供了出色的 4 位元純權重精度,且因為它依據的是激活值統計而非確切的校準文字,所以跨領域泛化良好;再搭配快速的融合 INT4 核心,使它成為在單一 GPU 或裝置端執行大型語言模型的主力工具。

y = (W\,\mathrm{diag}(s))\,(\mathrm{diag}(s)^{-1} x)

把權重乘以 diag(s)、激活值乘以其逆,輸出 y 不變,卻讓顯著通道更容易量化。

與 GPTQ 對照:GPTQ 用輸入海森矩陣補償捨入誤差,AWQ 則重新縮放通道,讓少數顯著通道得以乾淨地量化——對同一目標的不同解法。

又稱
AWQactivation-aware quantization激活感知權重量化