詞語化為數字(分詞與嵌入)
詞元嵌入(token embedding)
像 9246 這樣的詞元編號只是個標籤——它本身完全沒透露任何意義,而且 9245 與 9246 之間的關聯,並不比任意兩個門牌號碼更密切。詞元嵌入(token embedding)把這個光禿禿的編號變成一個向量:一串數字,也許有好幾千個,模型既能拿來運算,更關鍵的是還能學習。在訓練過程中,這些數字會被微調,讓用法相近的詞元逐漸朝相似的向量靠攏。
嵌入是模型最開頭的那一層。它在一張大表裡查出該編號對應的列,再把得到的向量交給網路其餘部分。和早期那種固定的詞向量不同,這些嵌入是和其他所有東西一起訓練的,因此最後會編碼出任務所需要的任何資訊。這正是那座橋樑,帶你從離散符號(也就是編號)跨進連續幾何,也就是向量的世界——神經網路真正動手運算的地方。
e = E[\,\text{id}\,] \in \mathbb{R}^{d}
編號從嵌入表 E 中選出一列,得到一個 d 維向量 e。
另見