基準與排行榜(benchmark and leaderboard)
/ BENCH-mark and LEE-der-bord /
基準(benchmark)是一套大家約定好、用來給自家模型打分的、固定且共享的測試——可說是AI界的一場統考。它把一個標準數據集、一項界定清楚的任務和一個公認的指標捆在一起,這樣當兩個研究團隊各自報出數字時,那些數字才真的指的是同一件事。排行榜(leaderboard)則是由此產生的排名:一塊公開的記分牌,列出誰得分最高,最新的排在最上面。
基準確有其價值。在它們出現之前,每篇論文都用自己的數據、自己的評分方式,進展根本無從比較。一個好的基準,把含糊的「更好」之說變成了一個任何人都能核驗的數字;而那些著名的基準——視覺領域的ImageNet、語言理解領域的GLUE——透過給所有人一個清晰的追逐目標,確確實實加速了整個領域。
但排行榜文化有其陰暗面,值得明明白白地點出來。當一個單一數字成了獎品,人們就會去為「這個基準」做優化,而不是為它本應代表的那種現實能力——這是個叫古德哈特定律的陷阱:當一項度量變成了目標,它就不再是個好的度量了。模型被反覆調校,有時甚至無意中在測試數據上訓練過,或被擬合到了某個基準的怪癖上;一個榜首分數,反映的可能是對那場統考的過擬合,而非真本事。而且任何基準都只是現實窄窄的一片——登頂它,不等於真在那份實際工作上幹得好。把排行榜名次當作一條證據,而絕不要當作證明。
一個模型以92%登頂某閱讀理解排行榜,超過了人類的89%。後來的分析發現,它鑽了一個空子——答案恰好是最長那句話的題目——而非真在閱讀。名次唬人,本事卻是空的:這是「鑽基準空子」的教科書式案例。
古德哈特定律的現身:一個被當成目標的數字,就不再度量它本該度量的東西了。
要警惕基準的飽和與污染:隨著一個基準變老,頂尖模型都擠在天花板附近,細微差異淪為噪聲;與此同時,測試題目越來越多地滲進了從網上爬取的訓練數據裡——在沒有真實進步的情況下把分數抬高。一個新鮮的、留出的或對抗性的基準,比一個著名卻已被榨乾的基準更有價值。