高效與邊緣人工智慧

N:M 稀疏(例如 2:4)

N:M 稀疏介於非結構化剪枝的不規則零與結構化剪枝的粗略區塊之間。它要求在每一組相鄰的 M 個權重中,至多有 N 個非零——熱門的 2:4 樣式即每四個保留兩個。這種細緻卻規則的結構,正是某些硬體所能加速的。

NVIDIA Ampere 及之後的 GPU 內建稀疏張量核心:給定以保留值加上 2 位元索引儲存的 2:4 權重矩陣,它能以最高達稠密兩倍的吞吐量執行矩陣乘法。產生這類權重會在每組 M 個之中套用幅度或重要度判準,通常再接微調;採用「剪枝—訓練—再剪枝」的排程有助於挽回精度。它也能與量化乾淨地疊加,達成複合壓縮。

問題在於,一旦把其他層與額外開銷算進去,那兩倍只是個極少能端到端實現的硬體上限;而強加 N:M 遮罩可能在敏感層上損失精度,因此它是有選擇地套用,而非全面採用。

\text{2:4 pattern: in every block of 4 weights } w,\quad \lVert w\rVert_0 \le 2

2:4 約束在每四個權重中至多保留兩個非零,正是稀疏張量核心所加速的形式。

又称
N:M sparsity2:4 sparsitysemi-structured sparsity半結構化稀疏