高效與邊緣人工智慧

低秩分解

一個大型權重矩陣往往做的工作比它的尺寸所暗示的還少——它的資訊集中在少數幾個主導方向上。低秩分解把一個稠密的 d×k 矩陣換成兩個瘦長矩陣 d×r 與 r×k 的乘積,其中秩 r 小得多,使參數量與乘加次數都從 d·k 降到 r·(d+k)。

經典做法是對訓練好的權重矩陣做截斷 SVD,保留前 r 個奇異方向,之後再微調分解後的層以挽回精度。相關想法包括用於卷積張量的 Tucker 與 CP 分解,以及在訓練端把更新參數化為低秩——也就是 LoRA 系列——使只需學習那些小因子。能移除多少秩,取決於矩陣的奇異值譜,而這在各層之間差異極大。

低秩方法能壓縮並加速,也與量化良好地疊加,但全域低秩是個很強的假設:許多 Transformer 權重矩陣更接近滿秩,所以除非按層選擇秩,否則粗率的分解反而可能傷害品質。

W \approx UV,\quad U\in\mathbb{R}^{d\times r},\; V\in\mathbb{R}^{r\times k},\quad r\ll\min(d,k)

當秩 r 很小時,以兩個瘦長矩陣的乘積取代 W,可把成本從 d·k 降到 r·(d+k)。

又称
low-rank factorizationmatrix factorization低秩分解