撞上資料牆
Chinchilla 擴展要求模型變大時也要更多詞元——但高品質人類文字的供給是有限的。當前沿訓練伸手要數兆詞元,團隊越來越常撞上一道資料牆:根本沒有足夠的新鮮、乾淨文字來維持運算最優。天真的補救——在同一批資料上多跑幾個世代(epoch)——有背誦而非學習的風險,尤其在去重把容易的冗餘剝掉之後。
當瓶頸是資料而非運算時的擴展
這把整個問題重新框定為 資料受限擴展:如何把固定的一池詞元發揮到極致。審慎的研究顯示,重複並非毫無價值——把資料重用幾個世代,能找回新鮮詞元的大部分價值,但好處衰減得很快,跑了幾遍之後,多加的世代幾乎沒有貢獻。所以當你拿不到更多資料時,聰明的做法是把那稀缺的資料花在刀口上、以其他形式增加運算,並只在仍划算的範圍內倚賴過度訓練。
Chinchilla 损失定律:当词元池 D 固定时,只有参数项继续减小——于是数据而非参数成为约束瓶颈。
架構提供了另一根槓桿。專家混合(mixture-of-experts)模型擁有龐大的參數量,卻只在每個詞元啟用其中一片,於是用每單位運算換到更多容量——當資料與服務預算同時咬緊時,這是一個局部的答案。
改把運算花在回答時
如果你無法再擴展訓練,那就擴展思考。推論期運算擴展 讓一個固定的模型,藉由「執行時多花運算」來得到更好的答案——產生一條長的思維鏈、抽樣多個候選解再挑最好的,或修訂自己的草稿。測試期運算(test-time compute)有它自己的擴展曲線:當你讓模型思考得更久,困難問題上的準確率會平滑上升,而 推理模型 正是為了駕馭這條曲線而打造。
自回归循环:将每个生成的词元反馈为输入以产生下一个。
兩筆預算,一個決定
現在你手上有兩個旋鈕,而 推論對訓練的擴展取捨 問的是:兩個各該怎麼轉。把一切都倒進一個更大的預訓練模型,每次查詢都便宜,但訓練帳單龐大無比。讓模型維持適中、每次查詢多想一會兒,則訓練便宜,但每個答案更貴。正確的配比,取決於模型會被查詢多頻繁、問題又有多難。
- 對於少被問、但極難的問題,倚賴推論:讓一個適中的模型長時間思考。
- 對於高流量、難度中低的工作負載,倚賴訓練:更強的基礎模型讓每一次便宜的呼叫都更好。
- 實務上,兩者混合——一個訓練良好、又懂得「何時該更努力思考」的模型。