評估與基準測試
評估大型語言模型(evaluating LLMs)
評估語言模型,就是用公平、可重複的方式問一個問題:它到底有多好。同一個模型可能寫出優美的詩,下一秒又自信地捏造一則假引用,所以單一次聊天永遠不夠。我們改用大量受控的任務來測——回答考題、解數學、寫程式、摘要文件——再統計它答對的比例。目標是一個你能信賴、能跨模型比較的數字,而不是一次幸運對話留下的感覺。
好的評估會區分三件事。能力:模型到底會不會做這個任務?可靠度:它是穩定做對,還是偶爾矇對?對齊:它在做的同時是否仍然有用、誠實、安全?每一項需要不同工具——對照標準答案的自動評分、兩兩對戰、人工評分,或讓另一個模型當裁判。沒有任何單一方法是完整的,所以認真的評估會疊用好幾種,並如實說出缺口。
誠實的難處在於:我們大多只量得到容易量的東西。選擇題的準確率很便宜;要判斷一篇長文是否真有洞見就難得多。因此基準測試永遠落後於真實世界的有用程度,高分是能力的證據,卻從來不是證明。
又称
另见