大規模訓練
最大更新參數化(μP)
直接在巨型模型上調超參數貴得令人卻步——一次全規模的學習率掃描,成本可能超過最終那一次訓練。μP 從改變網路的參數化方式下手,使其最優超參數在模型變寬時基本維持不變。它的承諾很具體:在一個小的代理模型上調好學習率與初始化,再把那些設定轉移到大上數個量級的模型,仍保持接近最優——這套程序稱為 μTransfer。
理論來自分析無限寬度極限。在標準參數化下,隨寬度成長,激活、梯度與權重更新的尺度會漂移,因此在某一寬度有效的學習率,在另一寬度就錯了。μP 規定了隨寬度而定的縮放——對初始化變異數、學習率,以及某些矩陣的逐層乘子——選得恰好讓每一層不論寬度都收到相同特徵尺度的更新。在此參數化下,損失地景中相關的幾何是寬度不變的,因此超參數最優點也是。
μP 把前沿模型的超參數搜尋從一場猜測變成一次轉移:你在便宜的模型上付一次調參成本,再於大規模上繼承它。它的提醒是:最乾淨的保證針對的是寬度(深度與其他軸需額外處理),而且它要求真的重寫模型的縮放——一筆真實但一次性的工程投入,不過這已成為大型預訓練的標準做法。
μP 並不是讓小模型表現得像大模型——它是讓兩者的最優超參數重合,因此轉移的是調參結果,而非模型品質。
又稱
另見