評估與基準測試

Elo 排行榜(Elo leaderboards)

Elo 排行榜把上千場兩兩對戰,化為每個模型一個評分,借用了當初為棋手排名而發明的系統。每個模型有一個數字;一場對戰勝出時評分上升、落敗者下降,而以弱勝強的爆冷會帶來更大的變動。比過夠多場後,評分穩定成一個排名,兩個數字之間的差距,能預測其中一個模型勝過另一個的頻率。

最有名的例子,蒐集真實使用者的匿名投票——使用者與兩個不具名的模型對話、挑出較好的回覆——再彙整成一個即時排行榜。由於提示來自真實的人、裁判也是真實的使用者,它捕捉到固定基準難以觸及的廣泛日常偏好,而且因為題目從不事先公開,它也抵抗死記。

要提醒的是:Elo 衡量偏好,而非真相,所以一個迷人、自信、排版漂亮的答案,可能勝過一個較正確卻乏味的答案。投票有雜訊,熱門模型對戰場次更多、評分也更穩,而群眾的口味未必等於你的任務。請把它讀成一個以人氣加權的相對排名,而不是能力或安全的絕對量度。

E_A = \frac{1}{1 + 10^{\,(R_B - R_A)/400}}

Elo 由評分差算出模型 A 勝過 B 的期望機率;領先 400 分預測約 10 比 1 的優勢。

又称
Chatbot ArenaBradley–Terry rankingarena leaderboard