預訓練

交叉熵損失(cross-entropy loss)

交叉熵損失是一個數字,告訴模型它對下一個詞的猜測錯得有多離譜。在每個位置,模型會為每一個可能的下一個詞元輸出一個機率;交叉熵只看它指派給「真正接續的那個詞元」的機率,並用該機率的負對數來懲罰它。猜中真相又信心十足,懲罰就微乎其微;給真相一個很低的機率,懲罰就很大。

在整個批次上取平均,這個損失正是梯度下降要往下推的對象——它的梯度告訴每個權重該往哪個方向移動,好讓真實的接續變得更可能。它還有個漂亮的詮釋:以位元計的交叉熵,就是資料在模型眼中的平均「驚訝程度」,而困惑度(perplexity)不過是它的指數,代表模型每個詞元上等可能選項的有效數量。

由於對數會狠狠懲罰「有信心卻答錯」,這個損失強烈地勸阻模型對它無法預測的詞元自以為是。在訓練過程中看著這個數字平順地下降,就是一次健康預訓練的脈搏。

\mathcal{L}_t = -\log P_\theta(x_t \mid x_{<t}), \qquad \text{perplexity} = e^{\,\bar{\mathcal{L}}}

每個詞元的交叉熵即真實詞元的負對數機率;困惑度則是它的指數。

又称
next-token lossnegative log-likelihoodlog loss