預訓練

訓練詞元預算(training tokens budget)

在算力固定的前提下,你面臨一個取捨:把模型做得更大,或者讓較小的模型吃更多資料。訓練詞元預算就是這個決定的後半段——要在多少詞元上訓練。長期以來,大家把模型做得很大卻餵得太少;Chinchilla 的結果指出,在給定的算力預算下,模型大小與詞元數量應該一起成長,而許多模型其實嚴重失衡。

那項研究給出一條好用的拇指法則:要達到算力最優,大約每個參數配二十個訓練詞元——所以一個一百億參數的模型,大概想要兩千億詞元上下。這個預算透過「訓練成本約等於六乘以參數乘以詞元」的關係,直接與算力相互牽動:把預算花在更多詞元上,就只能負擔更少參數,反之亦然。

實務上,團隊常常刻意大幅超過算力最優的詞元數。一個較小、卻吃了遠多於 Chinchilla 建議詞元的模型,訓練起來較慢,但此後永遠都更便宜地運行——當模型要服務數十億次查詢時,這是極划算的取捨。

N_{\text{tokens}} \approx 20 \times N_{\text{params}}

一條粗略的算力最優拇指法則:每個模型參數約配二十個訓練詞元。

又稱
token budgetdata budgetChinchilla-optimal tokens