JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

建立研究級的評估流程

把一切組裝成一套你能信任也能辯護的評估——圍繞主張設計、把統計做對、控制汙染、誠實報告,並直面開放的研究前緣。

圍繞主張而非數字來設計

每一個好的評估都始於一句你想辯護的話:「對我們的使用者而言,模型 X 在多步財務推理上勝過 Y」。這個主張決定了情境、指標與基線。借用 HELM 那種多軸的紀律——準確率校準穩健性成本——並抗拒過早把它們壓縮成單一分數。從主張反推而建的評估是可詮釋的;從手邊隨便撿來的基準拼湊的則不是。

  1. 寫下主張及其決策:評估結果不同,哪個行動會因此改變?
  2. 選擇能代表真實輸入分布的情境,而非只挑方便的公開資料集。
  3. 為每個情境挑指標並固定基線;事先決定評分方式(精確比對、執行、或評審)。
  4. 預先登記協定,讓你無法調到結果好看為止。

把統計做對

基準數字是帶誤差棒的估計,然而論文卻常只報裸點估計,並在小於雜訊的差距上加冕贏家。兩個變異來源很重要:對有限測試集的抽樣變異(報告信賴區間,例如以自助法 bootstrap),以及隨機生成造成的解碼變異(在多個隨機種子上取平均,並報告溫度(temperature))。在宣稱 A 勝 B 之前,用對逐題分數的配對檢定來檢查統計顯著性(statistical significance)——並記得「顯著」不等於「大到值得在意」。

\bar{x} \pm z_{\alpha/2}\,\dfrac{s}{\sqrt{n}}

基准分数只是一个估计值:应给出置信区间,而不是一个孤立的点估计。

控制汙染與洩漏

第 1 篇的威脅在操作層面回來了。公開基準可能在訓練語料中,因此高分可能是記憶。對策:偏好新鮮建立或時間閘控的測試集(在模型訓練截止之後才產生的資料)、施以汙染偵測(contamination detection)(與語料的 n-gram 重疊,或金絲雀字串),並設計一份你永不發表的無汙染(contamination-free)私有保留集。也要提防更微妙的資料洩漏(leakage):暗示答案的少樣本範例,或一個看過參考答案的評審。

污染就是划分被破坏:留出的测试样本绝不能出现在训练中,否则高分只是死记硬背。

数据被划分为相互独立的训练、验证和测试集。

對評審的信任,只能到你校準的程度為止

若你的流程使用 LLM 作為評審評分量表,那麼評審如今就是你量測儀器的一部分,本身也必須被評估。保留數百筆人類標註項目,量測評審與人類的一致度,並把它報告在每個經評審結果旁邊。套用第 3 篇的位置偏誤與長度控制,並探測評審的判決在改寫量表後是否仍成立。沒有報告一致度數字的評審式指標,就是沒有單位的量測——並把評審自身的校準(calibration)當成一個要驗證、而非假設的性質。

像对待任何分类器一样校准评判模型:用混淆矩阵衡量它与留出人工标注的一致性。

由真阳性、假阳性、假阴性和真阴性组成的混淆矩阵。

誠實地報告

最終交付物是一份持懷疑態度的同儕能查核的文件。寫明確切的提示、解碼設定與評分者;展示帶區間的逐情境結果,而非只有平均;納入失敗案例與迴歸,而非只有勝績;並寫下這次評估涵蓋什麼。最值得信任的評估,正是那些最清楚標出自身盲點的評估。

開放的前緣

評估是 AI 進展的瓶頸:能力如今跑在我們量測它的能力之前。開放問題無處不在——評估其軌跡無人能完整評分的長期程代理(agent)、建立能抵抗飽和的基準、評判開放式的創作與推理任務,以及把監督規模化到比評估者更強的模型。如果第一卷教你建造模型,本軌的教訓是:知道你建造了什麼,本身就是一門深刻而未竟的科學——而且在這門科學裡,細緻的工作仍能改變整個領域。

开放前沿:评估长程智能体,其『推理—行动—观察』的轨迹无人能够完整审阅。

智能体在推理、行动、观察三步之间循环。