規模法則與湧現
參數量規模(parameter-count scaling)
參數就是模型可調的旋鈕——它在訓練時微調的權重。參數量規模問的是最單純的成長問題:如果我固定資料,只是把網路加寬、加深、給它更多旋鈕,它會變好多少?跨越許多個數量級,答案是一條穩定的冪律改善:參數越多、損失越低,而且這個趨勢能畫出來、能預測。
固定詞元數,損失大約隨 N 的負 alpha-N 次方下降,其中 alpha-N 是實驗量到的一個小正數。更多參數讓網路有更多容量去儲存模式、慣用語與事實,於是它能更銳利地預測下一個詞元。但光有參數並不等於能力:一個餵不飽資料的巨型模型會過擬合,或單純浪費容量——這正是 Chinchilla 所診斷出的失衡。
純參數量是個誘人的頭條數字,但它只是三條規模軸之一。一個用稀薄資料訓練不足的千億參數模型,可能會輸給一個餵得飽飽的百億參數模型。
L(N) \approx \left(\frac{N_c}{N}\right)^{\alpha_N}
在資料充足時,損失隨參數量 N 的某次方下降。
又称
另见