評估與基準測試

MMLU 式基準測試(MMLU-style benchmarks)

這是一種橫掃人類知識的大型選擇題考試——歷史、法律、醫學、物理、倫理,還有數十個科目——用來測模型懂多少、又能在壓力下回想起多少。MMLU(大規模多任務語言理解)是最有名的例子:數千道四選一的題目,取自真實課程與專業考試。模型讀題後選 A、B、C 或 D,我們就用跨所有科目的準確率來評分。

它的吸引力在於廣度與評分簡單。一個數字就總結了 57 個領域的表現,而且因為答案只是單一字母,評分毫無模糊空間。它成了通用能力的預設頭條指標,而像 MMLU-Pro 這樣的後繼者則加入更難的題目與更多選項,以對抗飽和。

它的弱點是:選擇題獎勵的是「認出」正確答案,而非「產生」正確答案,而一次幸運的猜中,得分和真正理解一模一樣。這類題目也很容易滲入訓練資料,並可能含有標錯的題目,所以高 MMLU 分數代表知識廣博,卻幾乎說不出推理能力、誠實度,或模型在沒人提示時能否做出任何有用的事。

又稱
multiple-choice knowledge examsMMLU