為什麼需要標準化套組
如果每間實驗室都用自己私有的題目測試模型,沒有任何兩個數字能比較。基準測試套組(benchmark suites)用一組固定的題目、固定的答案、固定的計分規則解決這個問題。每個人都考同一份考卷,於是分數成了可以放上排行榜的共通貨幣。
多數公開基準測試是靜態資料集:一份輸入配上正確輸出的清單。模型回答每一題,自動檢查器與答案比對,然後回報準確率。功夫在於挑選那些夠難、能拉開強模型差距,夠明確、能自動評分,又夠廣、有意義的題目。
基准评分的核心:准确率就是答案与标准答案匹配的题目所占的比例。
知識與選擇題:MMLU 式
最常用的格式是選擇題。MMLU 式基準測試——得名自MMLU(Massive Multitask Language Understanding,大規模多任務語言理解)——橫跨數十個學科問上千道考試式題目,從歷史到醫學到法律,每題四個選項。評分極簡:模型選對字母了嗎?單一準確率百分比就概括了廣泛的書本知識。
選擇題方便但狹隘。它測的是在給定選項中辨認正確答案,而非從零生成答案——而且容易受幸運猜測與細微的格式技巧影響。強模型早已在 MMLU 上突破 85%,這也是為什麼較新的「MMLU-Pro」式題組會加入更難的題目與更多選項。
程式碼基準測試
程式碼對評估有個美妙性質:你可以把它跑起來。程式碼基準測試給模型一段函式說明與隱藏的單元測試。經典的 HumanEval 要求小型獨立函式,並用測試檢查;分數就是通過的比例——常以 pass@1 回報,也就是第一個樣本完全正確的機率。
HumanEval 的 pass@k:在采样的 k 个解中至少有一个通过隐藏单元测试的概率。
玩具函式不是真正的工程,所以更難的套組轉向整個程式庫。SWE-bench 交給模型一個真實的 GitHub 議題與完整程式碼庫,要它產出一份能讓專案真正的測試套組通過的修補(patch)。這衡量的東西遠比 HumanEval 更接近一個能運作的代理(agent)——而那裡的分數在短短幾年內從接近零攀升到過半。
推理與長脈絡探測
推理基準測試針對的是多步驟思考而非回憶:小學與競賽數學、邏輯方格、科學應用題。因為它們通常只有單一可檢查的最終答案(一個數字或短字串),所以評分乾淨,卻仍要求一串正確的中間步驟——而這正是把強推理者與樣式比對者區分開來的關鍵。
隨著脈絡視窗(context window)長到數十萬個詞元,我們需要長脈絡基準測試。經典探測是「大海撈針」:在一份巨大文件裡埋進一個事實再要模型找出來。模型常在頭尾擷取得很好,卻在中間失手——也就是迷失於中段效應——所以好的長脈絡測試會撒下多根針、要求把好幾根結合起來,並變化它們的位置。
交互式自注意力:点击一个词元会高亮它在整个序列中所关注的其他词元。
整體式套組:一次衡量多個面向
沒有單一基準測試能涵蓋一切,所以整體評估(holistic evaluation)框架回報的是一張矩陣:許多情境交叉許多指標——準確率、校準度、穩健性、公平性、毒性、效率。史丹佛的 HELM 讓這種做法普及。你得到的不是一個頭條數字,而是一張顯示取捨的剖面圖:模型 A 比模型 B 更準,卻更慢、毒性更高。