規模法則與湧現
下游與損失的規模對比(downstream vs. loss scaling)
規模法則對一個數字最乾淨:預訓練損失,也就是模型在留存文字上預測下一個詞元的好壞。但沒有人是為了下一個詞元預測器本身而推出產品——大家在乎的是它能不能回答問題、寫程式、或通過考試。下游與損失的規模對比談的就是這兩者之間的落差:平滑下降的損失,並不總是換成平滑上升的任務分數。
預訓練損失幾乎總是以乾淨的冪律隨規模變化。下游基準表現則雜亂得多:它可能平滑上升、突然跳起(也就是湧現的故事)、或在損失持續下降時幾乎不動。這份脫節一部分來自指標——把連續的機率換算成對/錯的分數會扭曲全貌——另一部分是真實的:有些技能要先跨過一個底層能力的門檻,才會開始顯現。研究者越來越傾向直接在下游指標上擬合規模法則,或找出能預測它們的中間量,而不是信任損失當代理。
更低的損失對更有用的模型是必要而非充分的。兩個預訓練損失完全相同的模型,在任務上可能天差地別,取決於資料配比、微調、以及技能是怎麼被引導出來的。
又称
另见