規模法則與湧現

算力預算分配(compute-budget allocation)

你很少能自由選擇資料與模型大小——你拿到的是一份算力預算,硬體負擔得起的固定浮點運算次數。算力預算分配就是把這一個數字,分給更大的模型和更多訓練詞元的動作。全花在大小上,模型就讀得不夠;全花在資料上,網路又太小、吸收不了。

因為訓練算力大約是 N 乘 D 的六倍,固定預算 C 就把你釘在一條曲線上:選了 N,D 就被決定,反之亦然。規模法則告訴你這條曲線上每一點的損失,而最低點就是算力最優的分配——也就是 Chinchilla 的等比成長答案。改變資料品質或那些指數,甜蜜點就會滑動,所以各家實驗室在投入旗艦級訓練前,都會為自己的設定重新擬合法則。

這只最佳化了訓練這筆帳。一旦把未來數百萬次推論算進來,你可能會理性地選一個較小、訓練更久的模型——它落在訓練最優曲線之外,卻在整個生命週期的總成本上勝出。

C \approx 6ND

固定的浮點運算預算 C,把模型大小 N 與詞元數 D 綁在同一條取捨曲線上。