詞語化為數字(分詞與嵌入)

詞元(tokens)

大型語言模型並不是逐字母或整句地閱讀文字,而是讀「詞元」(tokens)——一塊塊小小的文字片段。一個詞元可以是像「the」這樣常見的完整單字、像「ing」這樣的詞片、一個字元、一個標點符號,甚至是一個空格。在模型看到你的提示之前,分詞器(tokenizer)會先把文字切成一連串這樣的片段。你可以把詞元想成模型真正的字母表,只是這些「字母」是從海量文字中學到的常見片段,而不是你熟悉的二十六個字母。

每個詞元都對應一個整數編號,而模型自始至終只跟這些數字打交道。英文有個粗略的經驗法則:一個詞元大約是四個字元,約等於四分之三個單字,所以一千個詞元大概是 750 個英文字。計算詞元數很重要,因為計價、脈絡長度上限與速度都是以詞元為單位,而不是以單字計。中文、日文等不同書寫系統,以及程式碼,分詞方式往往很不一樣——有時效率還低很多。

又称
text tokenssubwords