应用:数据、图与动力系统

低秩模型与推荐系统

当你有一张巨大的用户乘物品表,且大多数元素缺失(没人给每部电影都评分)时,推荐系统背后的赌注是:这张表暗中是低秩的——少数隐藏因子(类型、基调、年代)解释了大部分偏好。找到这些因子,就能填补空白。

把评分矩阵 R 建模为两个瘦因子之积,R approx U V^T,其中行 u_i 是用户 i 在一个小的 k 维隐空间中的口味,行 v_j 是物品 j 在同一空间中的画像。预测评分是内积 <u_i, v_j>:当用户口味与物品特质对齐时取高值。秩 k 就是隐因子的个数。

若 R 完全可观测,最佳的秩 k 分解恰是截断 SVD(Eckart-Young 定理),保留前 k 个奇异值。但 R 大多缺失,故改为只在已观测元素上最小化平方误差,再加正则项,用交替最小二乘或梯度下降求解。当真实矩阵低秩且观测元素足够分散时,这种矩阵补全才会成功。

为何重要:这是电影、商品与音乐协同过滤背后的数学,同样的分解思想又出现在主题模型与嵌入中。警示:它继承了冷启动问题(新用户或新物品没有数据),补全保证假定不相干性与随机采样,而纯低秩拟合可能放大流行度偏置。

R approx U V^T, rank k; predicted rating = <u_i, v_j>; fit on observed entries only

把稀疏的评分矩阵分解为瘦的用户与物品因子;预测即内积。

Eckart-Young 定理给出保证:在所有秩 k 矩阵中,截断 SVD 在 Frobenius 与谱范数下都是最佳逼近。推荐系统就是这同一最佳低秩思想的缺失数据版本。

又称
matrix completioncollaborative filteringlatent factor models