規模法則與湧現
規模曲線外推(scaling-curve extrapolation)
訓練旗艦模型可能要花上數百萬美元和數週的叢集時間——你沒本錢用猜的去試。所以各家實驗室做的事更接近工程、而非煉金:他們訓練一梯子由小而便宜的模型,量出損失如何下降,再把那條線延長,去預測那個還沒蓋出來的巨人。這個預測就是規模曲線外推,也是一支團隊敢有信心地押下數百張 GPU 的依據。
拿幾次橫跨一段大小範圍的小規模訓練,擬合一條冪律——或是帶不可約下限的更完整形式——再把它代到目標規模上估值。做得好的話,一個大上一百倍的模型,其預測損失會落得驚人地貼近現實。要做對得很講究:梯子上各級的資料與調參要一致、大小的跨度要夠廣才釘得住斜率,最好還能把超參數遷移過去,讓大規模訓練表現得像放大版的手足、而不是另一頭怪獸。
外推對預訓練損失是可信的,但對下游技能就滑溜難料——它們可能突然跳起或卡住。你伸得越遠超出資料範圍,一個隱藏的轉折或一條斷裂的法則,就越可能冷不防地坑掉你的預測。
另见