代理式人工智慧與工具使用

代理評測基準

代理評測基準衡量的是「整個代理實際能完成什麼」,而不只是模型是否吐出好文字。它們設定具有明確結果的任務——修好這個錯誤、完成這筆購買、回答這個需要多工具的問題——並評分代理是否端到端地達成目標。重點從「給答案打分」轉為「給成就打分」,且發生在代理必須歷經多步驟互動的環境之中。

代表性的測試套件針對不同場景:SWE-bench 以「通過測試」評判是否解決真實 GitHub 議題、WebArena 及其後繼者測導覽擬真網站、OSWorld 測桌面電腦操作任務、GAIA 測多步驟使用工具的問題、tau-bench 測客服情境中對工具與規則的遵循。主流指標是任務成功率,常以允許多次嘗試的 pass@k 呈現,並輔以成本、步數與安全違規。好的基準強調「以執行為準、可檢查」的結果,而非與參考答案的表面相似度。

代理評測確實困難:長時程任務有許多有效解法路徑、環境具隨機性且可能漂移,部分給分也難以定義。結果對鷹架、所提供的工具與提示都很敏感,因此一個亮眼的成功率,反映鷹架的成分不亞於模型本身;而對熱門基準的污染或過度擬合,更可能在沒有真正能力增益的情況下灌水數字。

公布的代理成功率衡量的是「模型加上鷹架、工具與提示」的整體——更換鷹架對數字的影響,可能比更換模型還大。

又稱
agent benchmarksend-to-end agent evaluation代理基準