應用:資料、圖與動力系統

主成分分析

想像高維空間裡的一團資料點。大部分的分散可能只沿著少數幾個方向,而其他方向幾乎沒有變化。PCA 找出這些特殊方向,並按它們捕獲的變異數排序,於是你能用少得多的數字描述資料,卻幾乎不丟失資訊。

精確地說:先中心化資料使每個特徵均值為零,構造協方差矩陣 C,再計算它的特徵值與特徵向量。由於 C 對稱且半正定,譜定理保證存在一組正交歸一的特徵基。特徵向量就是主軸;特徵值 lambda_i 是沿第 i 個軸的變異數。保留前 k 個特徵向量,就在最小二乘意義下把資料投影到最佳的 k 維子空間。

等價地,對中心化資料矩陣 X(列為樣本)做 SVD。若 X = U Sigma V^T,則右奇異向量(V 的行)就是主軸,而 sigma_i^2 / (n-1) 是各變異數。SVD 路線在數值上更受青睞,因為它從不顯式地把資料平方成 C,從而避免精度損失。

為何重要:PCA 是壓縮、去噪與視覺化的首選第一步。但要注意,它只能看到線性的、二階的結構(變異數與協方差)。若有意義的結構是彎曲的或非高斯的,PCA 可能誤導;又因它追逐變異數,對特徵的尺度縮放很敏感。

C = (1/(n-1)) X^T X, C v_i = lambda_i v_i, variance along v_i = lambda_i

每個特徵值是其主軸所捕獲的變異數;將它們降序排列並保留前幾個。

透過協方差特徵分解的 PCA 與透過 SVD 的 PCA 在精確算術下給出相同的主軸,但在真實資料上請始終選 SVD 路線:構造 C 會把條件數平方,可能淹沒微小卻真實的變異數。

又稱
PCAKarhunen-Loeve transform