評估與基準測試
評估可重現性(evaluation reproducibility)
可重現性的意思是:如果你再跑一次同一套評估——或換成別人來跑——你會得到本質上相同的分數。這聽來理所當然,然而大型語言模型的基準以脆弱著稱:同一個模型在同一份測試上,會因為一些與它真實能力毫無關係的微小選擇,而擺盪好幾分。這種脆弱,使得跨論文的排行榜比較,實在難以信賴。
罪魁禍首很多。提示的措辭與排版、脈絡中範例的數目、如何從自由文字中解析出最終答案、取樣溫度、隨機種子、API 背後確切的模型版本,甚至浮點數與硬體差異,全都會牽動那個數字。兩個實驗室就算回報同一個基準,也可能單純因為評測程式不同而結果分歧。
解方是紀律:公開確切的提示與評測程式、釘住模型與函式庫版本、固定或回報解碼設定、跑多個種子並回報變異,並偏好共用的開放評估框架,讓所有人用同樣方式評分。一個沒有附上流程的分數,不是你能重現或比較的結果。
又称
另见