評估與基準測試
全面評估(holistic evaluation)
全面評估拒絕把模型壓縮成一個數字。它改為一次回報橫跨多種情境的多項指標——準確率,還有校準度、穩健性、公平性、偏見、毒性、效率與成本——讓你看見模型行為的整體形狀,包括它的取捨。重點在於:在準確率榜上奪冠的模型,也可能是最慢、最有偏見或校準最差的,而單一排行榜數字,恰恰藏起了部署時最要緊的那些事。
最有名的框架,攤開一張情境乘以指標的網格,讓每個模型跑過同樣的格子,然後公布整張表格,而非單一名次。這讓評估變得透明:你能看見測了什麼、在什麼條件下測、每個模型強在哪、弱在哪,並為你的需求挑模型,而不是為一個頭條數字挑模型。
代價是複雜度。指標越多,意味著越多運算、越難解讀,以及如何權衡彼此競爭之優點的抉擇——準確率多 2 分,值得延遲翻倍嗎?全面評估不替你回答這題;它讓取捨變得可見,好讓人能誠實地做決定。
又稱
另見