詞語化為數字(分詞與嵌入)

詞元編號(token ids)

模型沒辦法把「cat」這個字拿來做乘法——它需要數字。分詞器切好你的文字之後,會把每個詞元換成一個整數編號,也就是一個單純的索引,於是「cat」可能變成 9246。這個數字不是某種度量、也不是某種意義,它只是一個列號,告訴你詞元「cat」坐落在一張大查表的哪一列。不同的分詞器會給同一個字不同的編號。

真正進入模型的,是這串編號。每個編號用來挑出嵌入表的某一列,把光禿禿的索引變成一個向量,讓網路能對它做真正的數學運算。詞元與編號之間的對應,是分詞器訓練時就固定下來的字典,所以同樣的文字永遠會產生一模一樣的編號。生成文字則是反過來跑:模型預測出一個編號,再把它對應回詞元,然後變回可讀的字元。

又称
token indicesinput ids