規模法則與湧現
資料受限的規模化(data-constrained scaling)
到目前為止,每一個規模故事都假設文字實質上無限。事實並非如此。高品質人類書寫文字的供給——書籍、程式碼、用心寫的網頁——雖然龐大卻有限,而最大的那些模型,已經用掉了其中相當可觀的一部分。資料受限的規模化問的是:當你想繼續成長,世界卻快沒有新鮮、優質的詞元能餵你時,會發生什麼事。
一個選項是重複使用資料:研究發現,把詞元重用幾個週期幾乎和新資料一樣好,但每多跑一遍的價值會衰減,重複很多次之後,增加算力幾乎買不到什麼。其他槓桿則是從少榨多——積極的過濾與去重,讓每個詞元都算數、混入程式碼或其他模態、或謹慎地生成合成資料。每一招都只是把牆往後推,而非拆掉它,而合成資料還有讓模型反覆吃自己分布的風險。
這重新框定了整個領域的走向:算力與參數還能繼續成長,但如果獨特的高品質文字才是真正的瓶頸,未來的增益就取決於資料效率與新來源,而不只是更大的叢集。
又称
另见