JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

超越預訓練:推論期擴展與資料牆

當新鮮文字快用完、預訓練的回報趨於平坦,兩道新前沿就此打開:謹慎地重複使用資料,以及把運算花在「回答時」而非「訓練時」。

撞上資料牆

Chinchilla 擴展要求模型變大時也要更多詞元——但高品質人類文字的供給是有限的。當前沿訓練伸手要數兆詞元,團隊越來越常撞上一道資料牆:根本沒有足夠的新鮮、乾淨文字來維持運算最優。天真的補救——在同一批資料上多跑幾個世代(epoch)——有背誦而非學習的風險,尤其在去重把容易的冗餘剝掉之後。

當瓶頸是資料而非運算時的擴展

這把整個問題重新框定為 資料受限擴展:如何把固定的一池詞元發揮到極致。審慎的研究顯示,重複並非毫無價值——把資料重用幾個世代,能找回新鮮詞元的大部分價值,但好處衰減得很快,跑了幾遍之後,多加的世代幾乎沒有貢獻。所以當你拿不到更多資料時,聰明的做法是把那稀缺的資料花在刀口上、以其他形式增加運算,並只在仍划算的範圍內倚賴過度訓練

L(N,D)=E+\dfrac{A}{N^{\alpha}}+\dfrac{B}{D^{\beta}}

Chinchilla 损失定律:当词元池 D 固定时,只有参数项继续减小——于是数据而非参数成为约束瓶颈。

架構提供了另一根槓桿。專家混合(mixture-of-experts)模型擁有龐大的參數量,卻只在每個詞元啟用其中一片,於是用每單位運算換到更多容量——當資料與服務預算同時咬緊時,這是一個局部的答案。

改把運算花在回答時

如果你無法再擴展訓練,那就擴展思考推論期運算擴展 讓一個固定的模型,藉由「執行時多花運算」來得到更好的答案——產生一條長的思維鏈、抽樣多個候選解再挑最好的,或修訂自己的草稿。測試期運算(test-time compute)有它自己的擴展曲線:當你讓模型思考得更久,困難問題上的準確率會平滑上升,而 推理模型 正是為了駕馭這條曲線而打造。

推理算力扩展把更多算力花在回答时——在给出最终答案前生成更长的词元链。

自回归循环:将每个生成的词元反馈为输入以产生下一个。

兩筆預算,一個決定

現在你手上有兩個旋鈕,而 推論對訓練的擴展取捨 問的是:兩個各該怎麼轉。把一切都倒進一個更大的預訓練模型,每次查詢都便宜,但訓練帳單龐大無比。讓模型維持適中、每次查詢多想一會兒,則訓練便宜,但每個答案更貴。正確的配比,取決於模型會被查詢多頻繁、問題又有多難。

  1. 對於少被問、但極難的問題,倚賴推論:讓一個適中的模型長時間思考。
  2. 對於高流量、難度中低的工作負載,倚賴訓練:更強的基礎模型讓每一次便宜的呼叫都更好。
  3. 實務上,兩者混合——一個訓練良好、又懂得「何時該更努力思考」的模型。