机器学习工程与系统

缩放定律(scaling laws)

/ SKAY-ling lawz /

缩放定律,是这样一项经验发现:当你把三样原料一同加大——模型的大小、训练数据的多少、以及训练所耗的算力——模型的表现会以一种平滑、可预测的方式改善。了不起的地方在于那份「可预测」:误差并非随机地下降,而是沿着一条干净的数学曲线走,于是研究者在动手造一个大得多的模型之前,便能大致预报它会有多好,就像工程师在浇筑混凝土之前,凭已知公式估算一座桥的强度。

从系统的角度看,这是支撑起整个「把它造得更大就行」的 AI 时代的规划工具。倘若你知道那条曲线,你就能回答每个实验室都要面对的预算问题:给定一笔固定的钱和一堆芯片,我该如何在「更大的模型」与「更多的数据」之间分配,才能取得最好的结果?一个关键洞见(由「Chinchilla」那项研究普及开来)是:很长一段时间里,各实验室造的模型,相对它们所训练的数据而言都太大了——定律揭示出,用一个更小、却在多得多的数据上训练的模型,往往才更聪明。这些定律,把「我们该造多大?」从一个猜测,变成了一道计算。

为什么这很重要:缩放定律解释了这个领域为何把资源一股脑投入到越来越大的训练里去——回报是可预测的,也是真实的。但那些诚实的限度至关重要。改善是稳定却递减的:算力每翻一番,买来的收益都比上一番小,所以这条曲线从不许诺一次通向通用智能的骤然飞跃——它是温和地弯曲,而非向上扬成一道悬崖。定律描述的,是一个可度量的损失数值,而非现实世界中的有用程度;而且它们只在观测到的范围内成立;没人知道它们能外推多远。它们是一份强有力的规划指南,而不是一条自然法则,也不是一条通往超级智能的、有保证的路。

一个实验室有一笔固定的算力预算。天真的方案:造一个尽可能大的模型。缩放定律的方案:曲线显示,一个只有那一半大、却在四倍数据上训练的模型,以同样的成本实际上会表现更好——于是他们造那个更小、却喂得更饱的模型。

更大并不总是更好——这些定律把预算的分配,变成了一道计算,而非一时的直觉。

缩放定律描述的,是某个技术性损失度量上「平滑而递减」的改善——而不是一条通往通用智能的、有保证的路。资源每翻一番,买来的都比上一番少,而那些曲线,只在观测到的范围内得到验证。把它们信心十足地外推到大得多的疆域里去,那是希望,不是科学。

又称
neural scaling lawsChinchilla scaling缩放定律扩展定律规模定律