規模法則與湧現
過度訓練小模型(overtraining small models)
Chinchilla 說,一個小模型一旦讀到每個參數約二十個詞元就該停——再讀下去,你就是在浪費訓練算力。但訓練只付一次錢,服務卻要永遠付。如果你的模型要回答數十億次查詢,那麼持續拿遠超最優量的詞元去塞一個小模型,可能是一筆絕妙的划算交易,因為之後每一次查詢都跑在一個更便宜、更小的網路上。
刻意過度訓練會把模型推到遠超它的 Chinchilla 點——有時達到每個參數數百個詞元。在那個區間裡,訓練損失只緩慢地改善、早已過了報酬遞減,但回報是一個精巧的模型,它的推論成本固定而低廉。如今那些以小搏大的小型模型,通常正是因為這個理由而被用數兆詞元過度訓練:把成本從每次推論挪到只此一次的訓練。
一旦你計算的是生命週期成本、而非訓練成本,這就是理性的答案——也是算力最優訓練作為目標其實錯了的最清楚案例。它的限制在於資料:過度訓練會吞噬詞元,而高品質的文字可能會不夠用。
又稱
另見