JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

設計一套你能信任的評估

把一切組合起來:把指標綁定到真實決策、在能力與安全之間取得平衡,並把評估內建進你的交付流程。

從決策出發,而非從指標出發

好的評估始於一個你必須回答的問題:我們該上線這個模型嗎?該選 A 還是 B?該回退昨天的改動嗎?先講清楚決策,指標就會自然浮現。一個寫程式工具在意測試通過率與延遲;一個醫療助理在意事實性與對不安全建議的拒絕。沒有萬用的評估——只有針對這個決策的正確評估。

能力與安全是兩個不同的問題

牢牢守住能力對安全的區分。能力評估問「它能做好這份工作嗎?」並獎勵更多能力。安全評估問「它有守在界線內嗎?」並獎勵適當的拒絕。你不能把它們壓成單一分數,因為它們往相反方向拉——一個什麼都拒絕的模型在安全上拿滿分,在能力上不及格。

安全評估也需要對手。紅隊測試(red-teaming)主動獵捕能突破模型防護欄的提示,而危險能力評估(dangerous-capability evaluation)則專門探測那些一旦被濫用就有害的技能。一個只試溫和輸入的靜態安全基準測試,會嚴重高估你的模型究竟有多安全。

RLHF 依據人類偏好調整模型的護欄,而安全評估與紅隊測試正是用來探測這些護欄的。

示意圖:人類偏好比較訓練出獎勵模型,再用於調整策略。

整體式,而非單一數字

在你自己的規模上呼應整體評估的精神。回報一張小儀表板,而非單一數字:一個能力分數、一個安全分數、一個成本與延遲數字,以及一項穩健性檢查。把取捨攤開,能讓人類審慎地下判斷,而不是讓單一平均值悄悄替他們決定——也能凸顯出那種「品質贏、成本輸」的情況。

如果你的產品用了檢索,也要納入 RAG 評估:不只衡量最終答案,還要衡量是否檢索到了正確的文件、答案是否真的有依據(grounded)於那些文件。一條流程可能因為錯誤的理由給出很好的答案——而那正是日後會反咬你的失效。

RAG 評估不僅要看最終答案是否有據可依,還要評估檢索步驟本身。

流程:查詢檢索出文件,與提示一起送入模型生成答案。

評估驅動的開發

對產品而言,把評估當成測試套組。評估驅動的開發(evaluation-driven development)意味著在你調整提示或更換模型之前就先寫好評估案例,然後在每次改動時都跑它們,以捕捉回歸。用真實、雜亂的生產流量來建立套組——而非只用整潔的教科書輸入——並在每次使用者發現你漏掉的失效時擴充它。這就是務實的 大型語言模型產品評估的核心。

評估驅動開發讓評估成為活的基礎設施——納入版本管理,在循環中發現漂移並觸發再訓練。

生命週期循環:資料、訓練、部署、監測漂移、再訓練。

可信評估的檢核清單

  1. 講清楚這套評估要支撐的決策,以及對應到它的指標。
  2. 同時涵蓋能力與安全;跑紅隊與危險能力探測,而非只試溫和輸入。
  3. 使用保留或新建的資料以避免污染,並保留成長空間,讓測試不致飽和。
  4. 固定流程——提示、解碼、解析器、評測框架版本——讓結果可重現。
  5. 若使用大型語言模型評審,拿它對照人類標註做驗證,並控制位置與長度偏誤。
  6. 回報一張小型整體儀表板,並從每一次真實的生產失效中擴充套組。