評估與基準測試

困惑度(perplexity)

困惑度衡量模型看到沒見過的真實文字時有多「驚訝」。想像模型一個字一個字地讀句子,每次都猜下一個字、押一個賭注。如果它本來就預期到真正的下一個字,驚訝就很小;如果真正出現的字讓它大吃一驚,驚訝就很大。困惑度把這份驚訝在一段保留文本上取平均。數值越低越好:困惑度為 10,大致代表每一步模型的不確定程度,就像在約 10 個機率相等的字之間公平挑選。

嚴格說,它是模型賦予這些保留詞元的平均負對數似然取指數。因為只需要文本真正的後續,不需要任何標註或人工評分,所以它是我們最便宜的訊號,也是預訓練期間的標準尺規。困惑度較低的模型,按定義就是把語言的統計規律學得更緊密。

但困惑度低,不等於有用、真實或安全。它獎勵的是把流暢文本的下一個詞元預測好——這是必要的,卻遠遠不夠——而且你不能拿切詞方式不同的兩個模型來比困惑度。把它當成訓練時的溫度計,而不是成績單。

\mathrm{PPL}(x) = \exp\!\left(-\frac{1}{N}\sum_{i=1}^{N}\log p_\theta\!\left(x_i \mid x_{<i}\right)\right)

N 個保留詞元上平均負對數似然的指數;越低代表越不驚訝。

又称
PPL