詞語化為數字(分詞與嵌入)

詞彙表大小(vocabulary size)

模型的詞彙表是它認得的所有詞元的完整清單——它整套片段的字母表。詞彙表大小就是這份清單有多長,現代大型語言模型通常落在大約三萬到數十萬個項目之間。模型處理過的每一段文字,都只能用這份固定清單裡的詞元來表示,所以清單的大小會直接影響文字被怎麼切割。

這個選擇是真正的取捨。較大的詞彙表讓每個詞元能承載更多文字,於是序列更短、處理更快,但會讓嵌入層與輸出層變大、佔用更多記憶體,還會產生許多罕見詞元,因為見得太少而學不好。較小的詞彙表讓那些層維持精簡,卻把文字切成更多、更小的片段。多語言模型往往偏向較大的詞彙表,好讓每種語言都得到公平的涵蓋。

\text{embedding params} = V \times d

詞彙表大小 V 乘以嵌入維度 d,決定了嵌入表有多大。