JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

靜態基準:知識、真實性與程式

搭配自動評分的主力基準——MMLU、HELM、TruthfulQA、HumanEval/pass@k、SWE-bench 與長脈絡測驗——以及每一個究竟量到什麼、量不到什麼。

多選知識:MMLU

MMLU(大規模多任務語言理解,Massive Multitask Language Understanding)跨 57 個科目提出約 16,000 道多選題,從小學數學到專業法律。評分是單一機械動作:模型是否選了正確的字母?它的強項是廣度與可重現性;弱點則微妙:分數對提示格式與選項順序敏感,四選一隨機就有 25% 準確率,少數題目標註有誤。MMLU 量的是在乾淨格式下對既存知識的辨認——有用,但只是「智能」的一個窄切片。

整體式多指標評估:HELM

單一排行榜數字隱藏了取捨。HELM(語言模型整體評估,Holistic Evaluation of Language Models)以跨多個情境評估模型、並為每個情境報告多項指標來回應——不只準確率,還有校準、對擾動的穩健性(robustness)、公平性、偏誤、毒性、效率等——攤在一個透明的矩陣裡。重點不是加冕贏家,而是讓取捨變得可讀:更準的模型可能校準更差或更慢,HELM 在一個畫面上就讓你看見。

整體式評估很昂貴——多情境乘以多指標乘以多模型——但它是對單一數字文化的誠實制衡。當你在第 5 篇設計自己的評估套件時,HELM 就是範本:挑出對你的部署重要的軸,並全部報告出來。

真實性對流暢度:TruthfulQA

流暢的文字也可能自信地犯錯。TruthfulQA 由人類常持有迷思的問題構成(「折手指關節會怎樣?」),因此模仿網路的模型會重現流行的謬誤。它直接探測「聽起來對」與「真的對」之間的落差,並連結到更廣的幻覺(hallucination)問題。注意評分的微妙處:判斷真實性本身就需要一個評分者,這也是為什麼 TruthfulQA 同時附上微調分類器與人類標註——預示了第 3 篇的評審問題。

\text{score}=\frac{1}{N}\sum_{i=1}^{N}\mathbf{1}[\text{truthful}_i]\cdot\mathbf{1}[\text{informative}_i]

TruthfulQA 只奖励既真实又有信息量的回答,所以流畅但错误的回答得分为零。

可執行評估:HumanEval 與 pass@k

程式是少數能靠執行來檢查正確性的領域。HumanEval 提供 164 道帶隱藏單元測試的 Python 題目;唯有通過每個測試,解答才算正確。由於模型是隨機抽樣的,我們報告 pass@k:在 k 個抽樣補全中至少有一個通過的機率。關鍵在於,pass@k 是用 n > k 個樣本的無偏估計式來計算,而非天真地直接算,以避免高變異的估計。

\mathrm{pass@}k=\mathbb{E}_{\text{problems}}\!\left[\,1-\frac{\binom{n-c}{k}}{\binom{n}{k}}\,\right]

无偏的 pass@k:抽取 n 个样本,统计其中 c 个正确,估计随机取 k 个里至少有一个通过的概率。

# Unbiased pass@k from n samples, c of which pass (Chen et al., 2021)
def pass_at_k(n, c, k):
    if n - c < k:        # fewer than k failures: success is certain
        return 1.0
    # 1 - P(all k drawn are failures)
    prod = 1.0
    for i in range(n - c + 1, n + 1):
        prod *= 1.0 - k / i
    return 1.0 - prod
在不承受「剛好取 k 個樣本」之高變異下估計 pass@k。

從玩具函式到真實程式庫:SWE-bench

HumanEval 的題目是自足的片段。SWE-bench 把門檻提高到真實的軟體工程:每個任務都是熱門 Python 專案的實際 GitHub issue,模型(通常是能瀏覽檔案與執行測試的代理(agent))必須產出一個讓程式庫隱藏測試套件通過的補丁。這獎勵跨檔案導覽、理解既有程式碼與端到端解題——分數遠低於 HumanEval,這正是「真實工程很難」的誠實訊號。它是最能追蹤代理式編程進展的基準,與更廣的代理評估基準(agent evaluation benchmarks)互補。

讀得長:長脈絡評估

廠商宣傳巨大的脈絡視窗(context window),但長視窗不等於可用的視窗。長脈絡評估(long-context evaluation)對此施壓:經典的「大海撈針」測試在一份巨大文件的隨機深度埋入一項事實,要求模型取回,藉此揭露模型實際上忽略的位置。更難的變體要求跨多根針的多跳推理,或在整段脈絡上做彙總——許多在單針取回上滿分的模型在此崩潰。