湧現能力(emergent abilities)
/ ee-MUR-junt uh-BIL-uh-teez /
湧現能力,是指一些較小的AI模型根本做不到、卻彷彿在模型大到一定程度後「咔」地開啟的本領——好像它跨過了一道門檻,一項新能力就突然冒了出來。最經典的說法是:小模型在諸如多步算術、或遵循一條刁鑽指令上,幾乎得零分,可一旦過了某個規模,就開始答對,有時還從近乎零分一躍而至相當不錯。這看起來不太像漸進的改善,倒更像一次相變——就像水不是慢慢變成冰,而是在某個溫度上「翻」過去。
這件事引來巨大關注,因為它暗示:規模不只是打磨已有的技能,還可能解鎖你沒訓練過、也沒預料到的全新本領——這既令人興奮,又有點令人不安,因為你事先說不準一個更大的模型會突然變得會做什麼。它成了「為何要不斷造越來越大的模型」的一大招牌論據。
但這裡的誠實很重要,因為後來的研究強力反駁過。2023年一項有影響的分析指出:所謂「湧現」中有許多,其實是我們度量方式造成的假象:若你把一項任務按「全對才算分、否則零分」來評,改善看上去就像突然一躍;可若改用更平滑、給部分分的度量,同樣那些模型,往往一路都呈現穩步、漸進的進步。所以有些湧現能力是真正的驚喜,另一些則是度量造出的海市蜃樓。要點在於:對「它突然學會了X」這類戲劇化的說法保持懷疑,並去追問——這項能力當初是怎麼評分的。
在一項「每一位都對才算分、否則零分」的三位數加法任務上,小模型得約0%,大模型卻突然得80%——看起來像湧現。把同樣的輸出改按「每個答案對了幾位」來重新評分,你會看到:較小的模型其實早已把大部分位都答對了:那是平滑的上升,而非跳躍。能力是漸漸長起來的;是度量讓它看上去像個開關。
同樣的模型,兩種度量:一次「湧現式跳躍」可能被抹平成一條平滑曲線。
湧現一半是真的,一半是度量造成的假象。一句斬釘截鐵的「這能力在規模X處出現」,一旦改用給部分分的方式來評,往往就軟化成一條漸進的趨勢——所以在把某項突然冒出的本領當真之前,永遠先問一句:用的是什麼度量?