用幾個便宜的訓練擬合那條線
外推,正是規模法則賦予的超能力。因為冪次律損失曲線在對數—對數空間中是一條直線,你只需要幾個點就能把它釘住。訓練一系列小而負擔得起的模型——每個大小或詞元數各異——量測它們的損失,再用一條線穿過它們擬合。規模曲線外推 接著把那條線延伸到你從未訓練過的大小,預測一個遠超出你樣本的模型的損失。
损失对模型规模的对数-对数图,数据点落在一条下降的直线上。
在前沿訓練存在之前就預測它
這不只是理論。當代的前沿實驗室回報:他們能用一梯隊「小上數千倍」的訓練,預測旗艦模型的最終損失,而且預測得相當準。這正是「敢把數千萬美元押在單一次訓練上」之所以理智的原因:規模法則以可量化的信心,告訴了他們模型大概會落在哪裡。
- 訓練一梯隊小模型,橫跨很廣的大小或詞元數範圍。
- 在對數—對數空間中,對它們的損失擬合「冪次項加地板」。
- 外推到前沿大小,讀出預測的損失——並附上一條誠實的誤差棒。
- 啟動大型訓練;把結果與預測比對,好為下一次重新校準。
L(N) = L_{\infty} + \left(\dfrac{N_c}{N}\right)^{\alpha}
拟合两个部分:一个递减的幂律项,叠加在平坦的不可约损失下限 L∞ 之上,再读出前沿规模 N 处的损失。
乾淨的直線在哪裡彎折或斷裂
單一條直線是個美麗的理想化,但現實有時帶有關節。斷裂規模法則 描述的曲線:先沿著一條冪次法則走一段,接著彎折到另一個斜率——有時進步更快,有時停滯,有時一項原本平坦的能力突然燃起。一條天真地穿過某一段的直線,可能會嚴重誤判下一段。
損失是手段;能力才是目的
即使是完美的損失預測,仍留下一道缺口,因為沒有人會「上線一個低損失」——他們上線的是一個會做事的模型。把預測的損失翻譯成預測的實用性,正是 下游對損失擴展 那個困難、至今未解的問題。損失外推是可靠的;但把那份損失轉成基準或產品分數,則遠為搖晃——這正是為什麼「損失曲線看起來很乖」絕不代表可以省下審慎的 評估。