評估、基準測試與紅隊測試
勝率評估(win-rate evaluation)
勝率是模型輸出被判定優於一個固定參考模型的提示所佔的比例。不是給每個答案打絕對分,而是與一個基線(譬如 GPT-4 或前一個檢查點)正面對決,回報「模型 X 有 62% 的時候勝過基線」。它是 AlpacaEval 與多數指令微調比較背後的指標。
一個評審,人類或 LLM,就每個提示看兩個答案並選出勝者(平手對分或另計);把指示函數在評估集上平均,得到勝率與一個二項信賴區間。由於原始勝率會被長度與風格灌水,長度受控的變體如 LC-AlpacaEval 把回應長度迴歸掉,使模型無法單靠寫更多來爬升。勝率是序數且相對的:它告訴你相對於這個基線的排名,而非任何絕對意義上的差距大小。
不指明基線與評審,這個數字就毫無意義,而且它是非遞移的——A 勝 B、B 勝 C 不保證 A 勝 C。它也把「正確」與「被偏好」混為一談,所以在有可驗證答案的任務上,精確比對或執行式指標比偏好勝率更值得信賴。
\mathrm{WR} = \frac{1}{N}\sum_{i=1}^{N}\left(\mathbb{1}[\text{win}_i] + \tfrac{1}{2}\,\mathbb{1}[\text{tie}_i]\right)
將平手計為一半的勝率,對固定基線的 N 次成對比較取平均。
又稱
另見