詞語化為數字(分詞與嵌入)
子詞分詞(subword tokenization)
字典永遠不可能收錄所有單字:人們會發明新詞、打錯字、把詞拼接在一起。子詞分詞(subword tokenization)的解法是:把常見的完整單字保留為單一詞元,但把罕見或沒見過的單字拆成更小、可重複使用的片段。「unhappiness」可能被拆成「un」加「happiness」,「tokenization」可能被拆成「token」加「ization」。這些片段是經過挑選的,讓拆出來的部分本身也很常見,於是幾乎任何單字都能用模型已經認得的片段拼出來。
這是在兩種糟糕極端之間刻意取的折衷。一個單字一個詞元會得到龐大的詞彙表,遇到任何新字仍然卡住;一個字元一個詞元則詞彙表很小,卻把文字拉成超長的序列。子詞方案——位元組對編碼、WordPiece、Unigram——會從訓練語料庫學到一組固定的片段,讓高頻字維持完整,其餘的則優雅地退化成片段。實際的好處是:輸入的單字永遠不會真正「不認得」。
另見