規模法則與湧現

算力最優訓練(compute-optimal training)

想像一鍋固定的算力——比方說在叢集上跑一個月——和一個問題:我該怎麼花,才能換到最低的損失?你可以把它倒進更大的模型,或倒進更多資料上的更多訓練步數,但兩者不可能同時無限加。算力最優訓練就是那個能從這鍋固定算力中榨出最多能力的分配配方。

訓練算力大約是參數量乘以詞元數的六倍,所以一個預算 C 會描出一條取捨曲線:每選一個模型大小 N,就強迫對應一個詞元數 D。先用小規模實驗擬合規模法則,再在這條預算線上找出落在損失曲面最低點的 N 與 D。Chinchilla 的結論是經典答案——讓 N 與 D 一起成長——但最優分配會隨架構、資料品質、以及你量到的指數而移動。

算力最優指的是最便宜的訓練,不是最便宜的使用。整個框架完全忽略推論,這也是為什麼部署團隊常常刻意選一個次優、較小的模型。

C \approx 6ND

一條經驗法則:訓練一個稠密 Transformer,每個參數每個詞元大約花六次浮點運算。

又称
compute-optimal scaling