評估、基準測試與紅隊測試

以大型語言模型為評審(LLM-as-a-judge)

與其請人逐一為每個答案評分,不如把對話記錄與評分準則交給一個強模型,請它打分——在兩個答案中選較佳者,或給出 1 到 10 分。它便宜、快速、且足夠可重現,每小時能評估數千筆樣本,因此撐起了當代多數沒有單一參考答案可比對的開放式 LLM 評估。

兩種協定主導:成對比較(A、B 哪個較佳,可容許平手)與單一評分(依準則為單一回應打分)。評審的提示中包含問題、候選輸出與明確準則;請它先推理再下判斷能提升與人類的一致性。聊天任務上與人類的一致率常超過八成,可媲美標註者之間的一致度——但評審也繼承了偏誤:偏好先呈現的答案、較長的答案、自家風格的文字,以及重表面流暢而輕事實正確。

把評審當成有雜訊的量測儀器,而非神諭:用人工標註的子集校準它、隨機化答案順序並對兩種順序取平均,並避免讓模型在無防護下評判自家族系。它是品質的代理指標,可貴在能大規模便宜執行——但在能直接驗證正確性的任務上,它不能取代真實標準。

評審一致性是必要而非充分的——評審可能在簡單案例上與人類吻合,卻系統性地漏掉最要緊的困難、對抗性案例。

又稱
LLM judge模型評審model grader