規模法則與湧現

資料規模(data scaling)

現在反過來,固定模型,倒進更多文字。資料規模問的是:用同一個網路,多讀一些能把損失降多少?跟參數一樣,更多精選的詞元能換來平滑的冪律改善——一個讀過一兆詞元的模型,會比只讀過一千億的更流暢,而且這個增益可預測到足以拿來編預算。

固定 N,損失大約隨 D 的負 alpha-D 次方下降,其中 D 是訓練詞元數。更多資料意味著更多罕見字、冷門主題與長距離結構的範例,於是模型的估計更銳利,也更少胡亂死記。關鍵在於,品質與獨特性和純數量同等重要:重複或低品質的文字只增加詞元、卻不太增加訊號,甚至可能有害。

資料與參數要一起成長是有道理的——餵一個小模型無限的文字,或餵一個巨型模型稀薄的資料,兩者都會很快撞上報酬遞減。而高品質人類文字的供給是有限的,這讓這條軸線變成一個逼近中的限制。

L(D) \approx \left(\frac{D_c}{D}\right)^{\alpha_D}

在模型夠大時,損失隨詞元數 D 的某次方下降。

又称
dataset-size scaling