評估與基準測試

以大型語言模型當裁判(LLM-as-a-judge)

對於寫一封電子郵件、解釋一個概念這類開放式任務,並沒有單一正確答案可供比對,於是我們請一個強模型讀過回應後評分。裁判模型會拿到問題、答案(或兩個互相競爭的答案)以及一份評分準則——要有用、正確、結構良好——然後回傳分數或選出勝者。它是人工評分員又便宜又快的替身,幾分鐘內就能評上千則回應。

做得仔細時,它與人類判斷的吻合度高得驚人,這正是它如今支撐大量實務評估、甚至訓練某些環節的原因。但它也繼承了裁判自身的偏誤與盲點。裁判傾向偏好較長的答案、先呈現的選項、和自己風格相近的回應,以及它無法查證、卻語氣自信的錯誤主張。它可能被奉承或排版手法所操弄。

所以要把裁判當成一台需要校正的儀器,而非神諭:固定評分準則、隨機打亂答案順序以對抗位置偏誤、輪換由哪個模型擔任裁判,並抽樣與真實人工評分對照。一個從未對照過人類來驗證的裁判,量的是它自己的偏好,而不是品質。

裁判無法可靠地抓出它自己也會犯的錯;對於它無法查證的事實,它傾向獎勵自信而非正確。

又称
model-graded evaluationautomated grading