特徵值問題與奇異值分解

奇異值

奇異值是 SVD A = U Sigma V^T 中 Sigma 對角線上那些非負數 sigma_1 >= sigma_2 >= ... >= 0。感受它們最簡單的方式:一個矩陣把單位球面映成一個橢球(在輸出空間裡);奇異值正是那橢球各半軸的長度。最大的奇異值是矩陣能把任一單位向量拉伸到多長;最小的是它能把一個壓縮到多短。它們是矩陣的放大倍率,由大到小排序。

每個奇異值都帶有具體意義。sigma_1 就是矩陣的 2-範數 ||A||_2——最大拉伸。非零奇異值的個數是 A 的秩;在浮點下,「高於」雜訊地板的個數是數值秩。比值 sigma_1/sigma_min(最小非零者)是 2-範數條件數 kappa_2(A),是預測線性求解或最小平方擬合會放大多少誤差的最重要的單一數字。某個奇異值接近零,意味 A 幾乎把某個方向壓垮——它幾乎秩虧、幾乎不可逆。而奇異值透過 A^T A 與特徵值相連:sigma_i = sqrt(lambda_i(A^T A))。對對稱正定矩陣,奇異值等於特徵值;一般情形則不然(奇異值總是實數且非負;特徵值可能是複數或負數)。

為何如此在意?因為「排序後」的奇異值清單,即奇異譜,告訴你一個矩陣握有多少真正的資訊。若它們快速衰減——sigma_1、sigma_2 大、其餘極小——這矩陣本質上就是低秩、可壓縮的:少數幾組奇異三元組就捕捉了幾乎一切(這是壓縮、PCA、模型降階的基礎)。若衰減緩慢,資料就真的是高維的。而且關鍵地,奇異值是「完全良態」的(像對稱特徵值):把 A 擾動 epsilon,每個奇異值最多變動 epsilon。所以不同於非對稱矩陣的特徵值,奇異值總是可安心計算且可信賴。

一個奇異值為 10、9、8、然後 0.0001 的矩陣,實務上是秩 3:第四個方向被放大的倍率比第一個小一萬倍,多半是雜訊。它的條件數 10/0.0001 = 100000 警告求解 A x = b 約損失 5 位十進位數。丟掉那個極小的奇異值(截斷 SVD),就得到一個穩定、良態的近似,保留真正的訊號。

奇異值是像橢球的半軸長:矩陣的拉伸倍率,也是秩與條件數的診斷指標。

一般而言奇異值「不」等於特徵值的絕對值——該等式僅對對稱(正規)矩陣成立。對非對稱矩陣,兩者可能天差地遠:一個矩陣可以特徵值全為零卻有很大的奇異值(一個冪零的位移矩陣),所以單看特徵值可能嚴重誤導你對「矩陣如何放大向量」的判斷。

又称
singular spectrum奇異譜