評估、基準測試與紅隊測試

HumanEval(程式碼功能正確性基準)

HumanEval 隨 OpenAI 的 Codex 一同發布,是一組 164 道手寫的 Python 程式題。每題給出函式簽名與文件字串,模型寫出函式主體,正確與否不靠文字相似度判定,而靠執行——跑隱藏的單元測試並檢查是否全部通過。它讓功能正確性,而非與參考解的 n-gram 重疊,成為為生成程式碼計分的標準方式。

由於以執行為基礎,自然的指標就是 pass@k,而隱藏測試(平均每題數個斷言)使僥倖通過不太可能。題目刻意自我完備並由人手撰寫,以減少與網路爬取訓練資料的重疊。分數對評測框架敏感——提示格式、停止詞元、執行前是否清理補全內容——因此可重現性要求一條固定、共享的評估流程。

164 題數量小且偏向短的、演算法式的單函式任務,因此 HumanEval 難以預測大型程式庫或多檔案工程的表現——這正是 SWE-bench 想填補的落差。飽和與可能的污染促成了像 HumanEval+ 這類擴充,它加入遠多的測試,以揪出那些通過弱測試卻其實有錯的解。

又称
HumanEval函式合成基準