詞語化為數字(分詞與嵌入)

位元組層級分詞(byte-level tokenization)

當模型遇到一個從沒見過的字元——罕見的表情符號、不尋常的文字系統、一個壞掉的位元組——會怎麼樣?位元組層級分詞(byte-level tokenization)的做法,是從文字底下的原始位元組著手,確保這種情況絕不會出錯。因為電腦上的每個字元最終都是以一串位元組儲存,而位元組的可能值只有 256 種,所以任何想像得到的輸入都能被表示,沒有例外,也不需要特殊的「未知詞元」。

像 GPT-2 的位元組層級位元組對編碼這類分詞器,會先把文字轉成它的 UTF-8 位元組,再在這些位元組上學習合併規則。256 個位元組的基礎詞彙表保證了涵蓋率:任何東西,從古老文字到原始二進位,都能拼出來,最糟也不過是一個位元組一個位元組地拼。代價是不尋常的文字會碎成很多詞元,這正是為什麼某些非英文語言與長串表情符號,處理起來貴得出乎意料。