評估、基準測試與紅隊測試

SWE-bench(軟體工程基準)

SWE-bench 把標準從「寫一個函式」提高到「修好真實程式庫裡的真實臭蟲」。每個任務是一個熱門 Python 專案的真實 GitHub 議題,搭配當下時刻的程式庫;代理必須在眾多檔案間導航、編輯正確的檔案,並產出一個修補。成功與否由跑專案自己的測試套件決定——包含人類修補當初新增的那些測試——所以通過代表這個變更真的解決了議題。

一個實例綑綁了議題文字、程式庫快照與兩組隱藏測試:fail-to-pass 測試(修補前是壞的、正確修補後變好)與 pass-to-pass 測試(必須維持綠燈,用以抓回歸)。模型生成的差異被套用,套件在沙箱環境中執行;分數是完全解決的議題百分比。SWE-bench Verified 是經人工驗證的 500 個實例子集,移除了規格不全或不可能的題目,而 SWE-bench-Lite 是較便宜的子集——評測框架與子集選擇主宰了可比性。

分數高度取決於代理的鷹架(檢索、工具、迭代預算),而非僅僅基礎模型,所以一個 SWE-bench 數字描述的是整個系統,而非一個模型。原始集有記錄在案的污染與規格問題——這正是 Verified 的動機——而解決一個由測試把關的議題,並不能證明程式碼乾淨、可維護到人類審查者願意接受。

又稱
SWE-benchSWE-bench Verified