应用:数据、图与动力系统

嵌入作为低秩几何

嵌入把离散事物——词、用户、图节点——变成连续空间中的点,使几何编码含义:相近的点相似,方向能承载关系。其底层是线性代数:把一张巨大的稀疏关系表压缩进少数稠密的维度。

反复出现的配方是低秩分解。构造一个共现或相似度统计矩阵 M(哪些词出现在哪些词附近,哪些用户接触过哪些物品),再把它分解为 M approx W C^T,含瘦因子。W 的每一行是一个对象的嵌入向量,而内积 <w_i, c_j> 重建该统计量,于是数据中的相似度变成嵌入空间中的内积。

许多著名的嵌入恰是这一思想的化身。Word2vec 的带负采样的 skip-gram 可证地分解一个平移过的逐点互信息矩阵;GloVe 分解对数共现计数;经典的潜在语义分析不过是词-文档矩阵的截断 SVD。所选的秩就是嵌入维度,而 SVD 再次给出最佳的低秩拟合。

为何重要:嵌入是现代自然语言处理、推荐与图学习的输入层,其几何支撑类比与最近邻搜索。警示:线性内积模型只捕捉二阶、成对的结构(现代深度模型加入了非线性与上下文),而嵌入会忠实地吸收共现数据中存在的任何偏见。

M approx W C^T; similarity(i, j) = <w_i, c_j>; LSA = truncated SVD of term-document M

嵌入分解一个统计矩阵;因子行的内积编码相似度。

相似度变为内积,是统一的核心思想:一旦对象成了向量,余弦或点积就度量相关性,而最佳的固定秩向量集合又是由统计矩阵的 SVD 交到你手上。

又称
word embeddingsvector embeddingslatent representations