評估、基準測試與紅隊測試

聊天機器人競技場與 Elo 評分(Chatbot Arena)

聊天機器人競技場用群眾外包做評估。使用者輸入一個提示,兩個匿名模型並排作答,使用者投票選出較佳的回覆,之後才揭曉模型名稱。匯總數百萬筆這類盲測成對投票,便產生一個反映真實人類偏好的排名,用的是人們實際送出的雜亂、開放式提示——也就是固定基準從不曾見到的那部分行為。

投票以 Bradley–Terry 模型(常被稱為 Elo)轉換為評分:每個模型得到一個強度參數,A 勝過 B 的機率是兩者評分差的邏輯斯函數。對所有成對結果以最大概似法擬合這些參數,得到帶信賴區間的評分;邏輯斯形式意味著無論絕對水準如何,100 分的差距對應固定的勝率。

競技場量的是偏好而非正確性——它獎勵有幫助、格式與語氣,且可被風格操弄。投票是非平穩的(提示分布會漂移、模型會更新),自我選擇使使用者群偏斜,而少數高流量類別主導結果。它是主觀聊天品質目前最好的訊號,卻是事實嚴謹度很差的訊號,因此它補充而非取代以任務為本的基準。

P(A \succ B) = \frac{1}{1 + 10^{(R_B - R_A)/400}}

A 被偏好勝過 B 的機率,為兩者評分差的邏輯斯函數。

又称
LMArenaArena Elo聊天機器人競技場