規模法則與湧現
Chinchilla 算力最優(Chinchilla-optimal)
早期的大模型就像一個聰明絕頂卻幾乎沒翻過課本的學生:參數量驚人,卻只讀了太少的文字。2022 年 DeepMind 的 Chinchilla 實驗問了一個更乾淨的問題——在固定的算力預算下,模型大小與閱讀量該怎麼分配,才能把能力推到最高?答案出人意料:大多數巨型模型都嚴重地過大而餵不飽。一個較小、但讀了多得多詞元的模型,用同樣的訓練成本就能勝過它們。
Chinchilla 掃過數百次訓練,發現在算力最優的那一點上,參數量與訓練詞元應該同步成長——隨預算上升大致維持相等的比例。由此得出一條好用的經驗法則:每個參數大約配二十個詞元。照這個配方,一個七百億參數的模型會想要約 1.4 兆個詞元,而不是前輩們所用的區區幾千億。
這改寫了各家實驗室花錢的方式,讓「較小但詞元充足」的模型成了預設。但這條規則只在訓練成本這件事上最優;如果一個模型要服務數十億次查詢,你可能會故意打破它,刻意過度訓練一個較小的模型,來省下每一次推論的開銷。
N_{\text{opt}} \propto C^{0.5}, \quad D_{\text{opt}} \propto C^{0.5}, \quad D \approx 20\,N
在算力最優點上,模型大小與詞元量都隨算力的平方根成長——約每個參數配 20 個詞元。
又称
另见