JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

評斷開放式回答:人類、競技場與 AI 評審

當沒有標準答案時,你怎麼為一段文字評分?成對對戰、Elo 排行榜,以及讓模型評斷模型。

為什麼選擇題不夠

大型語言模型的多數真實用途都是開放式的:「幫我草擬這封信」、「解釋這個 bug」、「把這段話改得更友善」。沒有標準答案,而且兩個好回答可以長得天差地遠。有固定答案的基準測試無法評這種題,於是我們轉向評斷——請一位人類或另一個模型判斷哪個回答更好、為什麼。

問題在於評斷既主觀又昂貴。整套開放式評估的工藝,就是把主觀判斷做得夠一致、可比較、又負擔得起,才能信任。

人工評估

人工評估(human evaluation)是其他一切都拿來對照的黃金標準。你給評分者一份清楚的評分準則(rubric)——回答正確嗎、有用嗎、寫得好嗎、安全嗎?——再收集他們的分數。難在可靠度:未受訓的評分者會意見不合、會疲倦、會用不同方式理解指示。好的人工評估需要仔細的準則、每題多位評分者,以及一個一致性指標來確認他們衡量的是同一件事。

成對比較與勝率

這個洞見催生了成對比較(pairwise comparison):把同一個提示由兩個模型作答,並排呈現給評審,問哪個勝出(可以平手)。跑上千場這樣的對戰,每個模型就得到一個勝率(win rate)——它在一對一交鋒中勝出的比例。勝率直觀、不受評分基準漂移影響,而且直接回答使用者在意的問題:我會比較想要 A 還是 B?

成對資料也正是用來訓練基於偏好的對齊(alignment)的同一種訊號,所以你在這裡建立的評估,同時也是一扇窗,讓你看見模型正被往什麼方向最佳化。

用於為模型排名的成對偏好,也正是用來訓練模型的訊號:人類(或 AI)的兩兩比較先訓練一個獎勵模型,再用它微調策略。

圖示:在兩個回答之間的人類偏好訓練一個獎勵模型,再透過強化學習微調策略。

Elo 排行榜與競技場

你怎麼把一堆成對對戰變成單一排名?借用西洋棋的 Elo 評分系統。每個模型有一個分數;擊敗評分更高的模型得到的分數,比擊敗較弱的更多;分數最終穩定成一個全域順序。著名的聊天機器人競技場(Chatbot Arena)就用真實使用者做這件事:你輸入提示,得到兩個匿名回答,投票給較好的那個,你的票就推動兩個模型的 Elo。

E_A = \dfrac{1}{1 + 10^{(R_B - R_A)/400}}

Elo 的期望得分:模型 A 戰勝 B 的機率只取決於兩者的評分差,因此擊敗評分更高的模型能獲得更多分數。

競技場 Elo 強在提示真實又多元,投票者也不是在鑽固定測試集的漏洞。它的弱點正是這份強處的鏡像:投票會偏向看起來好的回答——更長、更自信、格式漂亮——即使更簡短的答案其實更正確;而罕見的專家任務也會被日常閒聊淹沒。

以大型語言模型當評審——以及它的偏誤

人工投票既慢又貴,所以這個領域越來越常用以大型語言模型當評審(LLM as a judge):提示一個強模型讀兩個回答並宣布勝者,或依準則為單一回答評分。做得好時,模型評審與人類多數意見一致的頻率高得驚人,成本卻只是零頭——讓你能一夜之間評估上千個案例。

但評審有你必須控制的系統性偏誤。位置偏誤(position bias):許多模型偏好它先讀到的那個回答,所以一定要兩種順序都評分再取平均。長度偏誤:評審過度獎勵冗長。自我偏好:評審可能偏愛自己風格的輸出。緩解方式是隨機化順序、固定一份準則、隱藏哪個模型產出哪個回答,並在信任它之前拿評審去對照人類標註做驗證

\hat{v}(A,B) = \tfrac{1}{2}\big(v(A,B) + v(B,A)\big)

消除位置偏差:讓評判模型對兩種排列順序各打一次分再取平均,這樣『誰排在前面』就不再左右勝負。