应用:数据、图与动力系统
主成分分析
想象高维空间里的一团数据点。大部分的分散可能只沿着少数几个方向,而其他方向几乎没有变化。PCA 找出这些特殊方向,并按它们捕获的方差排序,于是你能用少得多的数字描述数据,却几乎不丢失信息。
精确地说:先中心化数据使每个特征均值为零,构造协方差矩阵 C,再计算它的特征值与特征向量。由于 C 对称且半正定,谱定理保证存在一组正交归一的特征基。特征向量就是主轴;特征值 lambda_i 是沿第 i 个轴的方差。保留前 k 个特征向量,就在最小二乘意义下把数据投影到最佳的 k 维子空间。
等价地,对中心化数据矩阵 X(行为样本)做 SVD。若 X = U Sigma V^T,则右奇异向量(V 的列)就是主轴,而 sigma_i^2 / (n-1) 是各方差。SVD 路线在数值上更受青睐,因为它从不显式地把数据平方成 C,从而避免精度损失。
为何重要:PCA 是压缩、去噪与可视化的首选第一步。但要注意,它只能看到线性的、二阶的结构(方差与协方差)。若有意义的结构是弯曲的或非高斯的,PCA 可能误导;又因它追逐方差,对特征的尺度缩放很敏感。
C = (1/(n-1)) X^T X, C v_i = lambda_i v_i, variance along v_i = lambda_i
每个特征值是其主轴所捕获的方差;将它们降序排列并保留前几个。
通过协方差特征分解的 PCA 与通过 SVD 的 PCA 在精确算术下给出相同的主轴,但在真实数据上请始终选 SVD 路线:构造 C 会把条件数平方,可能淹没微小却真实的方差。
又称
另见