奇异值分解

SVD 的几何

关于线性映射,最具启发性的一个事实是:无论一个矩阵看起来多么纠缠,它们每一个都依次做同样的三件事。旋转、沿坐标轴拉伸、再旋转。SVD A = U Sigma V^T 字面上就是把这句话写成矩阵——V^T 旋转,Sigma 拉伸,U 旋转。

跟着一个向量 x 走一遍。先是 V^T 把 x 旋转,使右奇异向量对齐到坐标轴(正交映射,纯旋转/反射,无任何扭曲)。然后 Sigma 把第 i 轴拉伸 sigma_i 倍(若 A 非方阵,还会丢弃或补充维数)。最后 U 把拉伸后的结果旋转到输出空间。旋转、拉伸、旋转——这就是任何线性映射所做的全部。

最干净的图景是 A 对单位球的作用。球面不被那两次旋转改变,所以全部塑形都发生在拉伸那一步:球面变成一个椭球。这个椭球各轴的方向是左奇异向量 u_i,各半轴的长度是奇异值 sigma_i。A 的全部行为都被那一个椭球捕获——朝向与拉伸尽在一图。

这种几何悄然解释了这个领域里的其余一切。最长的半轴 sigma_1 是谱范数(最大拉伸);一条为零的半轴是被压扁的方向,即零空间;最长与最短之比是条件数;压扁最小的那些轴就是低秩逼近。一旦你看见这个旋转-拉伸-旋转的椭球,SVD 理论的其余部分不过是从那幅图中读出细节而已。

unit sphere --V^T(rotate)--> sphere --Sigma(stretch)--> ellipsoid --U(rotate)--> oriented ellipsoid

A 把单位球映为椭球:各轴是诸 u_i,半轴长度是诸 sigma_i。

特征分解只给出沿可能斜交的轴的拉伸,没有干净的旋转解读,且只对特殊矩阵成立。SVD 那两次分开的正交旋转,正是它对每个矩阵都奏效的原因。

又称
rotate-stretch-rotateellipsoid picture