規模法則與湧現

不可約損失(irreducible loss)

語言並非完全可預測。即使是完美的模型,當貓和狗都說得通時,也無法知道下一個字是哪個——真實文字帶有真正的隨機性,以及脈絡根本框不住的資訊。所以當你往上擴大規模時,損失不會一路衝到零;它會滑向一個下限。那個下限就是不可約損失:誤差中再多的參數、資料或算力都拿不掉的那一部分。

在標準的擬合裡,損失被寫成一個常數 E,加上隨大小與資料縮小的冪律項。那些項可以被壓得任意小,但 E 會留下來——它是文字本身的熵,是在任何脈絡下語言固有的不可預測性。規模化買到的是可約的部分;不可約的部分由資料分布決定,而非模型。損失曲線變平往往是你正在逼近 E 的徵兆,而不是規模化失靈。

E 並非普世不變——它取決於資料集、分詞器,以及模型看得到多少脈絡。更乾淨、更有結構的資料有更低的下限,這又是一個說明資料品質、而不只是數量在形塑極限的理由。

L(N, D) = E + \frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}}

常數 E 是下限;只有冪律項會隨規模縮小。

又称
irreducible errorentropy floor