預訓練

預訓練算力(pretraining compute)

預訓練算力是訓練一個模型所花掉的總運算量,通常以浮點運算次數(FLOPs)來計。它是打造 LLM 的主要成本——前沿的訓練動輒數千萬美元,需要數千顆 GPU 協同運作數週甚至數月。算力是幾乎所有其他決策都圍繞著規劃的那筆預算。

有一個出奇簡單的估算:訓練一個稠密的 Transformer,每個參數、每個詞元大約花六個 FLOPs——前向約兩個、反向約四個。所以一個模型的總訓練算力,接近六乘以它的參數量再乘以訓練詞元數。這條小公式讓團隊能事先為一次訓練估價,並決定如何把固定預算分配給「更大的模型」與「更多的資料」。

算力是縮放律背後的槓桿:跨越許多個數量級,損失會隨算力增長而可預測地下降。但這是一種報酬遞減的關係——損失每再降一點,代價就指數般地增加——而且光看 FLOPs 並不能說明它們是花得有效率,還是浪費在糟糕的資料與訓練不穩上。

C \approx 6 \, N_{\text{params}} \, N_{\text{tokens}}

標準估算:以 FLOPs 計的訓練算力,約等於六乘以參數量乘以訓練詞元數。

又称
training FLOPscompute budget