詞語化為數字(分詞與嵌入)

語意向量空間(semantic vector space)

一旦每個詞元或單字都成了向量,你就能把它們全想成散布在一個高維空間裡的點。從訓練中學到的驚人之處在於,這個空間是有幾何結構的:意義相近的點最後會彼此靠近,而方向本身也能承載意義。「king」與「queen」會落在彼此附近,而從「king」走到「queen」的那一步,可以很像從「man」走到「woman」的那一步。

這裡的「靠近」通常是用餘弦相似度來衡量,也就是兩個向量之間的夾角,而不是單純的直線距離。這套幾何結構從來不是設計出來的,而是浮現出來的——因為模型因「能從鄰近詞預測出一個詞」而受獎勵,於是共享脈絡的詞就被拉到一起。這正是嵌入能驅動搜尋、分群與類比的原因。但這個結構是近似的、充滿怪癖——它是一張有用的意義地圖,而不是一張完美的地圖。

\cos(\theta) = \dfrac{a \cdot b}{\lVert a \rVert\,\lVert b \rVert}

餘弦相似度衡量兩個嵌入向量有多對齊,數值介於 -1 到 1 之間。

又稱
embedding spacelatent space