應用:資料、圖與動力系統

低秩模型與推薦系統

當你有一張巨大的使用者乘物品表,且大多數元素缺失(沒人給每部電影都評分)時,推薦系統背後的賭注是:這張表暗中是低秩的——少數隱藏因子(類型、基調、年代)解釋了大部分偏好。找到這些因子,就能填補空白。

把評分矩陣 R 建模為兩個瘦因子之積,R approx U V^T,其中列 u_i 是使用者 i 在一個小的 k 維隱空間中的口味,列 v_j 是物品 j 在同一空間中的畫像。預測評分是內積 <u_i, v_j>:當使用者口味與物品特質對齊時取高值。秩 k 就是隱因子的個數。

若 R 完全可觀測,最佳的秩 k 分解恰是截斷 SVD(Eckart-Young 定理),保留前 k 個奇異值。但 R 大多缺失,故改為只在已觀測元素上最小化平方誤差,再加正則項,用交替最小二乘或梯度下降求解。當真實矩陣低秩且觀測元素足夠分散時,這種矩陣補全才會成功。

為何重要:這是電影、商品與音樂協同過濾背後的數學,同樣的分解思想又出現在主題模型與嵌入中。警示:它繼承了冷啟動問題(新使用者或新物品沒有資料),補全保證假定不相干性與隨機取樣,而純低秩擬合可能放大流行度偏置。

R approx U V^T, rank k; predicted rating = <u_i, v_j>; fit on observed entries only

把稀疏的評分矩陣分解為瘦的使用者與物品因子;預測即內積。

Eckart-Young 定理給出保證:在所有秩 k 矩陣中,截斷 SVD 在 Frobenius 與譜範數下都是最佳逼近。推薦系統就是這同一最佳低秩思想的缺失資料版本。

又稱
matrix completioncollaborative filteringlatent factor models