評估與基準測試
基準測試套件(benchmark suites)
基準測試套件是一組固定、公開的任務,所有人用同樣的方式跑,讓不同模型站在同一起跑線上比較。可以把它想成標準化考試:對每位考生都是同一份題目、同一套評分規則、同一種考試條件。每道題通常附有已知的正確答案,所以可以自動評分——數一數答對的比例,分數就出來了。把許多任務捆成一個套件,比任何單一測試更能看出全貌。
套件之間的差異在於它們探測什麼:廣泛知識、寫程式、數學、閱讀理解、安全、多語能力、長輸入。它們也會固定流程——提示怎麼措辭、給幾個範例、如何從自由文字中抽出答案。這些細節影響極大;同一個模型只因換了提示模板,分數就可能擺盪好幾分,這正是可信套件會公開其精確評測程式(harness)的原因。
它們的價值在於可比較與可重現,但它們是靜態的快照。一個套件一旦流行,答案就會外洩到網路上,模型開始把它背起來,於是套件慢慢不再衡量推理,而是衡量熟悉度。
又称
另见