應用:資料、圖與動力系統

嵌入作為低秩幾何

嵌入把離散事物——詞、使用者、圖節點——變成連續空間中的點,使幾何編碼含義:相近的點相似,方向能承載關係。其底層是線性代數:把一張巨大的稀疏關係表壓縮進少數稠密的維度。

反覆出現的配方是低秩分解。構造一個共現或相似度統計矩陣 M(哪些詞出現在哪些詞附近,哪些使用者接觸過哪些物品),再把它分解為 M approx W C^T,含瘦因子。W 的每一列是一個對象的嵌入向量,而內積 <w_i, c_j> 重建該統計量,於是資料中的相似度變成嵌入空間中的內積。

許多著名的嵌入恰是這一思想的化身。Word2vec 的帶負取樣的 skip-gram 可證地分解一個平移過的逐點互資訊矩陣;GloVe 分解對數共現計數;經典的潛在語義分析不過是詞-文件矩陣的截斷 SVD。所選的秩就是嵌入維度,而 SVD 再次給出最佳的低秩擬合。

為何重要:嵌入是現代自然語言處理、推薦與圖學習的輸入層,其幾何支撐類比與最近鄰搜尋。警示:線性內積模型只捕捉二階、成對的結構(現代深度模型加入了非線性與上下文),而嵌入會忠實地吸收共現資料中存在的任何偏見。

M approx W C^T; similarity(i, j) = <w_i, c_j>; LSA = truncated SVD of term-document M

嵌入分解一個統計矩陣;因子列的內積編碼相似度。

相似度變為內積,是統一的核心思想:一旦對象成了向量,餘弦或點積就度量相關性,而最佳的固定秩向量集合又是由統計矩陣的 SVD 交到你手上。

又稱
word embeddingsvector embeddingslatent representations