高效與邊緣人工智慧
Wanda(依權重與激活剪枝)
Wanda 是一套出奇簡單的方法,能在不重新訓練的情況下剪枝大型語言模型。它為每個權重評分時,不只看權重的幅度,還乘上它所相乘的輸入的大小——直覺是:作用在大且經常活躍的輸入上的小權重,可能比作用在微小輸入上的大權重更重要。
具體而言,對輸出神經元 i,權重 W_ij 的重要度是 |W_ij| 與輸入特徵 j 在小型校準集上量得的 L2 範數的乘積。Wanda 在每個輸出列內部比較權重——是一種每輸出的比較,而非全域門檻——把分數最低的歸零以達到目標稀疏度,並可選擇排成 2:4 的樣式。整個過程沒有梯度、沒有逆海森矩陣,也完全沒有更新權重。
儘管如此簡單,Wanda 在中等稀疏度下仍能匹敵甚至勝過 SparseGPT 等昂貴得多的一次性剪枝法,因此是一個強而快速的基準。在極高稀疏度下,它與基於重新訓練的方法之間的差距會重新拉開,所以最好把它視為便宜的第一步。
S_{ij} = |W_{ij}|\cdot \lVert X_j\rVert_2
Wanda 的每權重分數:幅度乘以輸入特徵的激活範數——不需重新訓練。
又称
另见