一個看似簡單的問題
問別人一台新車好不好,他們會反問:好在哪——賽車、載貨,還是省油?評估大型語言模型也一樣。一個大型語言模型(large language model)可以寫十四行詩、除錯程式碼、摘要合約,也可能自信地捏造一則假的引用——有時在同一次對話裡全做了。沒有任何單一的「好壞」可以從儀表上讀出來。
所以評估的第一項工作不是算分數,而是講清楚你在意的是什麼:事實正確性、有用性、推理能力、延遲、成本、安全性。先講清楚,才能挑出衡量它的方法。略過這一步,你就會去最佳化一個與真正想要的東西不相符的數字。
困惑度:模型自己的成績單
最內在(intrinsic)的指標直接源於模型的訓練方式。因為大型語言模型做的是下一個詞元預測(next-token prediction),我們可以問:在一段沒看過的保留文字上,它對每個真實的下一個詞元有多驚訝?把這份驚訝取平均再取指數,就得到困惑度(perplexity)——粗略地說,是模型在每一步猶豫的有效選項數。越低越好。
困惑度其實就是平均交叉熵損失(cross-entropy loss)取指數,所以它便宜、可重現,也非常適合追蹤預訓練。但對使用者而言它有個致命限制:它衡量的是模型對某一段特定文字預測得多好,而不是它的回答是否有用、正確或安全。一個模型可以有極佳的困惑度,卻照樣胡說八道。
困惑度就是每個詞元平均交叉熵的指數——數值越低,表示模型越不感到意外。
文字的自動指標——以及它們失靈之處
當有一個參考答案——例如黃金標準的翻譯或摘要——我們可以用 BLEU、ROUGE 這類文字自動指標(automatic text metrics)。它們計算模型輸出與參考答案之間重疊的字詞與片語。它們快速、確定性高、又便宜,這正是它們撐起機器翻譯研究十年的原因。
候選詞集與參考詞集的文氏圖:精確率是重疊部分佔候選答案的比例,召回率是重疊部分佔參考答案的比例。
麻煩在於:對開放式生成而言,有很多好答案,彼此幾乎沒有共用的字詞。「會議在中午」和「我們將於下午十二點集合」意思相同,互相比對卻得分很差。字詞重疊指標獎勵的是表面模仿,而非語意——所以對現代聊天模型來說,它們是一個薄弱、容易被鑽空子的訊號,主要只能當作粗略的回歸(regression)檢查。
我們真正在意的:能力與安全
幾乎每一項評估背後都有兩大類問題。能力(capability):模型究竟能不能完成任務——推理、寫程式、回憶事實、遵循指令?安全(safety):當它能做時,是否守在界線內——拒絕有害請求、避免幻覺(hallucination)、抵抗操弄?這個區分就是能力對安全的差別,而兩者常相互取捨:一個什麼都拒絕的模型「安全」卻沒用;一個什麼都照做的模型有能力卻危險。
本軌道接下來都依循這張地圖。我們會先看標準化基準測試(大規模衡量能力),再看人工與 AI 評審(開放式品質),接著看基準測試如何欺騙我們,最後看如何組裝一套你真能信任的評估——同時涵蓋能力與安全。