缩放定律(能力,scaling laws)
/ SKAY-ling lawz /
缩放定律,是一种令人惊讶的经验规律:当你用越来越多的数据、越来越强的算力去训练越来越大的AI模型时,它们的表现会以一种平滑、可预测的方式改善——不是随机的跳跃,而是沿着一条你能画出来、还能外推的稳定曲线前进。这有点像发现:平均而言,发动机越大,可靠地输出越多成比例的功率——这种关系规整到足以据此做规划。
更确切地说,研究者在2020年前后发现:当你增大三样配料——模型规模、数据规模、算力——模型的预测误差会沿着一种整洁的数学关系(幂律)下降。这件事意义重大,因为它让实验室在砸下数百万去训练之前,就能大致预报一个模型会有多好;它也大体解释了过去几年的策略:投入更多规模,能力就沿着曲线往上爬。这里的「定律」,指的是一种稳健的观测趋势,而不是像引力那样的自然法则。
有两条诚实的提醒很要紧。其一,那条平滑曲线衡量的,通常是一个底层统计量(模型预测下一个词元的好坏),它和我们真正在意的实用能力并不是一回事——后者出现得可能要参差得多。其二,缩放既不免费也非无限:它要耗费巨大的金钱、能源和数据,而且确有忧虑——高质量训练数据正在告急,回报也在递减。缩放定律描述的是迄今为止发生过的事;它并不保证「继续堆下去」就会一直划算,也不保证「单靠规模」就是通往通用智能的那条路。
一家实验室筹划一个新模型。它用从较小训练拟合出的缩放定律曲线估算:一个规模大10倍、用多10倍数据训练的模型,应能把预测误差降低一个可预测的幅度——于是在训练前就拍板预算,预期结果会落在预报附近。正是这种预报能力,而非什么魔法,让「规模」成了主导策略。
缩放定律让实验室在掏钱训练之前,就能预报模型的损失。
「定律」一词言过其实。缩放定律是在某一区间内观测到的规律性,而非永远成立的保证——当数据质量、模型类型、或你所衡量的对象一变,它可能弯折甚至失效。一条迄今成立的趋势是证据,而不是对下一个数量级的承诺。