評估、基準測試與紅隊測試
準則式評估(rubric-based evaluation)
準則把含糊的「為這個答案評分」換成一份明確的標準清單。以一個醫療答案為例,或許是事實準確性、安全提醒、完整性與清晰度,各有定義好的等級與權重。把品質拆解成具名、可觀察的構件,使評分透明、跨評審更一致,也可除錯:你能看出模型在哪個面向失分,而不只看到它分數低。
實務上把準則交給評分者——人類或以 LLM 為評審——為每項標準打分,有時是二元清單(答案是否含事實 X、是否警告了 Y)再加總,有時是加權成總分的等級量尺。相較於單一整體分數,逐項或清單式評分大幅降低變異與位置及冗長偏誤,並產生可解讀、可稽核的判斷。當代的無參考評估器與獎勵模型越來越以這種方式內化準則。
準則的好壞全繫於其標準:選得差的項目會獎勵表面順從而非真正品質,而要窮盡列舉「好」的意涵本身就很難。準則也有被操弄的風險——為了打勾而優化——並且它把主觀性從分數轉移到準則的設計,而非消除它,所以準則本身必須被驗證。
又稱
另見