JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

湧現能力:真正的躍升,還是量測的假象?

有些能力似乎在模型越過某個大小門檻後憑空出現。一場激烈的辯論在問:這種「湧現」是真的,還是我們評分方式造成的把戲。

現象:一項突然「開啟」的能力

把某項特定能力——比如三位數加法,或遵守一條刁鑽的指令——對模型大小作圖。對小模型來說,分數貼近零,平坦又沒用。接著,過了某個大小,它就竄了上去。研究者把這稱為 湧現能力:一種在小模型中基本不存在、卻在大模型中(看似)突然出現的能力。這個詞借自物理與生物學——在那裡,系統作為整體會做出其組成部分做不到的事。

最有名的例子,是模型從未被明確訓練去做的能力。情境內學習(in-context learning)——只憑提示裡的幾個範例就學會新任務、完全不更新權重,也稱為 少樣本提示(few-shot prompting)——會隨規模急劇增強。思維鏈推理(chain-of-thought)也是如此:要求一個夠大的模型「一步一步想」會突然有幫助,但對小模型用同樣的把戲卻毫無作用。

為什麼它感覺近乎魔法

湧現之所以令人不安,是因為規模法則承諾的是平滑。損失曲線是一條整齊、沒有轉折的冪次法則——然而這裡卻有一項下游能力,看起來像開關被撥動。如果底層的訓練損失是連續滑降的,那這項能力上突如其來的懸崖,是從哪裡來的?這些 湧現的推理能力,正是讓大模型同時「在商業上令人興奮」又「在科學上令人困惑」的那一批。

「海市蜃樓」的反論

2023 年,史丹佛的一個團隊點燃了 湧現之爭,主張許多看似湧現的現象,是我們量測方式的假象,而非模型本身。他們的關鍵觀察是:那些急劇的躍升,往往出現在嚴苛、全有或全無的評分標準下,例如完全比對準確率。一個 30 位數的答案只錯一位,你也得零分——直到過了某個大小,你終於每一位都對,才跳到滿分。

\mathrm{Accuracy}_{\text{exact}} \approx \prod_{i=1}^{N} p_i = p^{N}

严苛的精确匹配指标把逐词概率相乘,于是平滑上升的 p 变成了陡然跃升——这正是「海市蜃楼」论点的核心。

損失是平滑的;計分板不必然如此

要同時握住雙方的最乾淨方式,是 下游對損失擴展 的區分。預訓練損失平滑地進步——這點沒有爭議。看起來突兀的,是下游基準分數,因為把損失轉換成基準數字的那個函數,可能很陡、或帶有門檻。在這個觀點下,湧現作為使用者的體驗是真的,但並不是模型底層能力的不連續。

L(N) \approx \left(\frac{N_c}{N}\right)^{\alpha_N}

预训练损失随模型规模 N 呈幂律下降——它持续平滑地改善,这一点无人争议。

由此得出兩個實用的教訓。第一,提防 基準飽和 與脆弱的評分標準——一條「先平後跳」的曲線,可能說的是你的尺,而不是你的模型。第二,平滑的評分標準是規劃的好朋友:它們讓你能預測能力,而不是被它偷襲。下一篇指南正是直接建立在這點上,把曲線變成你敢押上預算的預測。