評估與基準測試
人工評估(human evaluation)
人工評估讓真正的人介入,直接評斷模型的輸出——評一則回應有多有用、正確、流暢或安全,常用量尺打分,或從兩個答案中挑出較好的那個。它仍是黃金標準,因為我們最終在乎的那些事(這真的有用嗎?它誠實嗎?我會信任它嗎?)都是人類的判斷,沒有任何自動指標能完全捕捉。
實務上的機制很重要。你需要清楚的指示、每題多位評分員以平均掉個人怪癖,還要量測他們之間的一致程度(評分者間一致性);一致性低,代表問題本身就含糊。執行良好的人工研究,能抓到基準完全錯過的失敗——細微的不誠實、語氣、文化契合度、部分正確。
代價是真實存在的:它慢、貴、難以精確重現,也容易帶有自身偏誤。評分員會錨定於長度與自信、會疲倦、會帶入文化假設。所以人工評估用在最關鍵之處——最終的模型比較與安全審查——而較便宜的自動與模型評分方法承擔大部分工作,再回頭以人工評分驗證。
又称
另见