評估與基準測試
文字自動指標(automatic text metrics)
在模型評分問世之前,替自由文字評分的便宜辦法,是拿模型的輸出去比對一份或多份由人撰寫的參考答案,量測詞語的重疊程度。為機器翻譯而生的 BLEU,獎勵與參考相符的短詞序列;為摘要而生的 ROUGE,獎勵涵蓋參考的內容。兩者都快速、確定,且評分時不需要人,這讓它們多年來成為文字生成的主力。
它們的致命弱點是只看得到表面形式。一個用字不同卻完美的改寫會得低分,而一個流暢卻錯誤、恰好重用了參考字詞的答案反而得高分。它們無法判斷意義、事實正確性或推理,還假設那唯一一份參考就是唯一可接受的答案——這對多數開放式任務並不成立。
較新的以嵌入為基礎的指標,比的是意義而非確切字詞,與人類判斷的相關度較好,但趨勢已轉向以大型語言模型當裁判,以及對任何開放式任務採用人工評分。重疊指標則以快速、可重現的合理性檢查之姿存活下來,而不再是品質的最終裁決。
又称
另见