縮放定律(scaling laws)
/ SKAY-ling lawz /
縮放定律,是這樣一項經驗發現:當你把三樣原料一同加大——模型的大小、訓練資料的多少、以及訓練所耗的算力——模型的表現會以一種平滑、可預測的方式改善。了不起的地方在於那份「可預測」:誤差並非隨機地下降,而是沿著一條乾淨的數學曲線走,於是研究者在動手造一個大得多的模型之前,便能大致預報它會有多好,就像工程師在澆築混凝土之前,憑已知公式估算一座橋的強度。
從系統的角度看,這是支撐起整個「把它造得更大就行」的 AI 時代的規劃工具。倘若你知道那條曲線,你就能回答每個實驗室都要面對的預算問題:給定一筆固定的錢和一堆晶片,我該如何在「更大的模型」與「更多的資料」之間分配,才能取得最好的結果?一個關鍵洞見(由「Chinchilla」那項研究普及開來)是:很長一段時間裡,各實驗室造的模型,相對它們所訓練的資料而言都太大了——定律揭示出,用一個更小、卻在多得多的資料上訓練的模型,往往才更聰明。這些定律,把「我們該造多大?」從一個猜測,變成了一道計算。
為什麼這很重要:縮放定律解釋了這個領域為何把資源一股腦投入到越來越大的訓練裡去——回報是可預測的,也是真實的。但那些誠實的限度至關重要。改善是穩定卻遞減的:算力每翻一番,買來的收益都比上一番小,所以這條曲線從不許諾一次通向通用智能的驟然飛躍——它是溫和地彎曲,而非向上揚成一道懸崖。定律描述的,是一個可度量的損失數值,而非現實世界中的有用程度;而且它們只在觀測到的範圍內成立;沒人知道它們能外推多遠。它們是一份強有力的規劃指南,而不是一條自然法則,也不是一條通往超級智能的、有保證的路。
一個實驗室有一筆固定的算力預算。天真的方案:造一個盡可能大的模型。縮放定律的方案:曲線顯示,一個只有那一半大、卻在四倍資料上訓練的模型,以同樣的成本實際上會表現更好——於是他們造那個更小、卻餵得更飽的模型。
更大並不總是更好——這些定律把預算的分配,變成了一道計算,而非一時的直覺。
縮放定律描述的,是某個技術性損失度量上「平滑而遞減」的改善——而不是一條通往通用智能的、有保證的路。資源每翻一番,買來的都比上一番少,而那些曲線,只在觀測到的範圍內得到驗證。把它們信心十足地外推到大得多的疆域裡去,那是希望,不是科學。