智能體與前沿

縮放定律(能力,scaling laws)

/ SKAY-ling lawz /

縮放定律,是一種令人驚訝的經驗規律:當你用越來越多的數據、越來越強的算力去訓練越來越大的AI模型時,它們的表現會以一種平滑、可預測的方式改善——不是隨機的跳躍,而是沿著一條你能畫出來、還能外推的穩定曲線前進。這有點像發現:平均而言,發動機越大,可靠地輸出越多成比例的功率——這種關係規整到足以據此做規劃。

更確切地說,研究者在2020年前後發現:當你增大三樣配料——模型規模、數據規模、算力——模型的預測誤差會沿著一種整潔的數學關係(冪律)下降。這件事意義重大,因為它讓實驗室在砸下數百萬去訓練之前,就能大致預報一個模型會有多好;它也大體解釋了過去幾年的策略:投入更多規模,能力就沿著曲線往上爬。這裡的「定律」,指的是一種穩健的觀測趨勢,而不是像引力那樣的自然法則。

有兩條誠實的提醒很要緊。其一,那條平滑曲線衡量的,通常是一個底層統計量(模型預測下一個詞元的好壞),它和我們真正在意的實用能力並不是一回事——後者出現得可能要參差得多。其二,縮放既不免費也非無限:它要耗費巨大的金錢、能源和數據,而且確有憂慮——高品質訓練數據正在告急,回報也在遞減。縮放定律描述的是迄今為止發生過的事;它並不保證「繼續堆下去」就會一直划算,也不保證「單靠規模」就是通往通用智能的那條路。

一家實驗室籌劃一個新模型。它用從較小訓練擬合出的縮放定律曲線估算:一個規模大10倍、用多10倍數據訓練的模型,應能把預測誤差降低一個可預測的幅度——於是在訓練前就拍板預算,預期結果會落在預報附近。正是這種預報能力,而非什麼魔法,讓「規模」成了主導策略。

縮放定律讓實驗室在掏錢訓練之前,就能預報模型的損失。

「定律」一詞言過其實。縮放定律是在某一區間內觀測到的規律性,而非永遠成立的保證——當數據品質、模型類型、或你所衡量的對象一變,它可能彎折甚至失效。一條迄今成立的趨勢是證據,而不是對下一個數量級的承諾。

又稱
scaling lawsneural scaling laws缩放定律縮放定律尺度定律