評估與基準測試

兩兩比較(pairwise comparison)

兩兩比較不要求評分員給一個答案打出十分制的絕對分數,而是同時呈現對同一提示的兩個答案,問一個更簡單的問題:哪一個比較好?人在相對判斷上遠比絕對判斷可靠——要說一篇文章值不值 7 分很難,但要說「這篇勝過那篇」卻很容易。把大量這樣的投票彙整起來,就得到勝率:一個模型在對戰中獲勝的比例。

這種格式同時支撐人工偏好研究與模型評分,也是偏好訓練模型背後的原料——勝出的答案教模型人們喜歡什麼。它對量尺漂移很穩健,因為你永遠只在比較,從不需要去校正一個數字。

它的弱點很微妙。哪個答案先被呈現會左右投票(位置偏誤),所以必須隨機打亂順序,或把兩種順序平均。勝率也只告訴你 A 勝過 B,卻不告訴你贏多少,而一個模型可能樣樣險勝、卻樣樣不出色。要把大量兩兩結果轉成單一排名,通常會餵進 Elo 或 Bradley–Terry 模型。

又稱
A/B preferenceside-by-side evaluationwin rate