圍繞主張而非數字來設計
每一個好的評估都始於一句你想辯護的話:「對我們的使用者而言,模型 X 在多步財務推理上勝過 Y」。這個主張決定了情境、指標與基線。借用 HELM 那種多軸的紀律——準確率與校準與穩健性與成本——並抗拒過早把它們壓縮成單一分數。從主張反推而建的評估是可詮釋的;從手邊隨便撿來的基準拼湊的則不是。
- 寫下主張及其決策:評估結果不同,哪個行動會因此改變?
- 選擇能代表真實輸入分布的情境,而非只挑方便的公開資料集。
- 為每個情境挑指標並固定基線;事先決定評分方式(精確比對、執行、或評審)。
- 預先登記協定,讓你無法調到結果好看為止。
把統計做對
基準數字是帶誤差棒的估計,然而論文卻常只報裸點估計,並在小於雜訊的差距上加冕贏家。兩個變異來源很重要:對有限測試集的抽樣變異(報告信賴區間,例如以自助法 bootstrap),以及隨機生成造成的解碼變異(在多個隨機種子上取平均,並報告溫度(temperature))。在宣稱 A 勝 B 之前,用對逐題分數的配對檢定來檢查統計顯著性(statistical significance)——並記得「顯著」不等於「大到值得在意」。
基准分数只是一个估计值:应给出置信区间,而不是一个孤立的点估计。
控制汙染與洩漏
第 1 篇的威脅在操作層面回來了。公開基準可能在訓練語料中,因此高分可能是記憶。對策:偏好新鮮建立或時間閘控的測試集(在模型訓練截止之後才產生的資料)、施以汙染偵測(contamination detection)(與語料的 n-gram 重疊,或金絲雀字串),並設計一份你永不發表的無汙染(contamination-free)私有保留集。也要提防更微妙的資料洩漏(leakage):暗示答案的少樣本範例,或一個看過參考答案的評審。
数据被划分为相互独立的训练、验证和测试集。
對評審的信任,只能到你校準的程度為止
若你的流程使用 LLM 作為評審或評分量表,那麼評審如今就是你量測儀器的一部分,本身也必須被評估。保留數百筆人類標註項目,量測評審與人類的一致度,並把它報告在每個經評審結果旁邊。套用第 3 篇的位置偏誤與長度控制,並探測評審的判決在改寫量表後是否仍成立。沒有報告一致度數字的評審式指標,就是沒有單位的量測——並把評審自身的校準(calibration)當成一個要驗證、而非假設的性質。
由真阳性、假阳性、假阴性和真阴性组成的混淆矩阵。
誠實地報告
最終交付物是一份持懷疑態度的同儕能查核的文件。寫明確切的提示、解碼設定與評分者;展示帶區間的逐情境結果,而非只有平均;納入失敗案例與迴歸,而非只有勝績;並寫下這次評估未涵蓋什麼。最值得信任的評估,正是那些最清楚標出自身盲點的評估。
開放的前緣
評估是 AI 進展的瓶頸:能力如今跑在我們量測它的能力之前。開放問題無處不在——評估其軌跡無人能完整評分的長期程代理(agent)、建立能抵抗飽和的基準、評判開放式的創作與推理任務,以及把監督規模化到比評估者更強的模型。如果第一卷教你建造模型,本軌的教訓是:知道你建造了什麼,本身就是一門深刻而未竟的科學——而且在這門科學裡,細緻的工作仍能改變整個領域。
智能体在推理、行动、观察三步之间循环。