規模法則與湧現

神經規模法則(neural scaling laws)

訓練一整個語言模型家族——從很小的、中等的,到非常巨大的——再把它們預測文字的好壞,對上你投入的資源畫成圖。這些點不會雜亂散落,而是落在一條平滑、微微彎曲的曲線上。把模型放大十倍、餵十倍的文字、或多花十倍的算力,預測誤差每次都會以穩定、可預測的比例下降。這種規律就是規模法則:一個量化的承諾,說明更多資源能以你事先就能描繪的方式換來更強的能力。

具體來說,測試損失會隨三個旋鈕呈冪律下降——參數量 N、訓練詞元數 D、與算力 C,每一項都長得像 A 除以 N 的某次方。冪律在雙對數座標上會是直線,所以幾次小規模實驗就能擬合斜率,預測一次超大規模的訓練。這些法則完全不在意你用哪種架構;它們跨越各種模型大小都驚人地成立,這也是各家實驗室把它們當成規劃工具、而非奇觀的原因。

但有個陷阱:損失下降不等於學會了有用的技能,而且每條法則最終都會碰上一條跨不過去的下限。規模法則指引預算的分配;它並不保證模型真的會推理。

L(N, D) = E + \frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}}

測試損失等於不可約下限 E,加上對參數 N 與資料 D 的冪律項。

又称
scaling lawsLLM scaling laws