評估、基準測試與紅隊測試

大規模多任務語言理解(MMLU)

MMLU 是一套涵蓋 57 個學科的多選題測驗——從基礎數學、美國史,到專業法律、醫學與大學物理。每題四個選項,分數就是單純的準確率,通常以少樣本(典型為 5-shot)方式回報。它之所以成為「模型懂多少」的預設代表數字,正因為其廣度難以靠在單一技能上的狹隘優化來刷高。

計分有破壞天真比較的細節。你可以讀取模型生成的答案字母,也可以比較四個選項詞元的對數機率取最大值——兩者數字不同,因此跨模型結果必須用相同的評測框架。隨機猜測得 25%;當前前沿模型已超過 88%,壓縮了可進步空間,並放大了 MMLU 已知含有的少數標錯或語意含糊題目的影響。

由於 MMLU 自 2020 年起公開流傳,污染是現實的疑慮,而天花板已近到後繼者如 MMLU-Pro(十個選項、更難的誘答、更重推理的題目)被設計出來以恢復鑑別度。把單一 MMLU 數字讀作儲存知識的粗略代理,而非對推理深度的定論。

\mathrm{acc} = \frac{1}{N}\sum_{i=1}^{N} \mathbb{1}\!\left[\hat{y}_i = y_i\right]

N 道四選一題目上的單純準確率;隨機基線為 0.25。

高 MMLU 分數反映的是儲存的知識加上應試技巧,而非推理深度;逼近人類專家天花板時,微小差距在統計上很脆弱。

又稱
MMLU大規模多任務語言理解