評估、基準測試與紅隊測試
語言模型整體評估(HELM)
史丹佛提出的 HELM 把評估重新框定為一個矩陣,而非單一排行榜數字。它在眾多情境(問答、摘要、情感分析等)上跑眾多模型,更關鍵的是同時沿著眾多指標衡量——不只是準確率,還包括校準度、穩健性、公平性、偏見、毒性與效率——讓單一準確率數字所掩蓋的取捨並排可見。
其設計原則是明確與覆蓋。情境依任務、領域與語言組織;每個模型在標準化的提示協定下執行,使數字可比;而每個(模型、情境)的格子在適用處都以完整的指標套件量測。這套分類法讓落差可被稽核——你能看到某個準確率高的模型其實校準很差,或對乾淨輸入穩健卻在擾動下脆弱,而不是把這些全壓成單一排名。
整體性的廣度需要算力與策展成本,而指標權重終究是價值判斷——沒有標準方法能把七個面向壓平成單一排序。HELM 持久的貢獻與其說是一個分數,不如說是一種紀律:透明地回報眾多情境與眾多指標,讓讀者自行權衡對其用途要緊的面向。
HELM 的重點是:不指明評估面向,「最佳模型」就無從定義——一個模型可能準確率居首,卻在校準、公平或成本上墊底。
又稱
另見