基准与排行榜(benchmark and leaderboard)
/ BENCH-mark and LEE-der-bord /
基准(benchmark)是一套大家约定好、用来给自家模型打分的、固定且共享的测试——可说是AI界的一场统考。它把一个标准数据集、一项界定清楚的任务和一个公认的指标捆在一起,这样当两个研究团队各自报出数字时,那些数字才真的指的是同一件事。排行榜(leaderboard)则是由此产生的排名:一块公开的记分牌,列出谁得分最高,最新的排在最上面。
基准确有其价值。在它们出现之前,每篇论文都用自己的数据、自己的评分方式,进展根本无从比较。一个好的基准,把含糊的「更好」之说变成了一个任何人都能核验的数字;而那些著名的基准——视觉领域的ImageNet、语言理解领域的GLUE——通过给所有人一个清晰的追逐目标,确确实实加速了整个领域。
但排行榜文化有其阴暗面,值得明明白白地点出来。当一个单一数字成了奖品,人们就会去为「这个基准」做优化,而不是为它本应代表的那种现实能力——这是个叫古德哈特定律的陷阱:当一项度量变成了目标,它就不再是个好的度量了。模型被反复调校,有时甚至无意中在测试数据上训练过,或被拟合到了某个基准的怪癖上;一个榜首分数,反映的可能是对那场统考的过拟合,而非真本事。而且任何基准都只是现实窄窄的一片——登顶它,不等于真在那份实际工作上干得好。把排行榜名次当作一条证据,而绝不要当作证明。
一个模型以92%登顶某阅读理解排行榜,超过了人类的89%。后来的分析发现,它钻了一个空子——答案恰好是最长那句话的题目——而非真在阅读。名次唬人,本事却是空的:这是「钻基准空子」的教科书式案例。
古德哈特定律的现身:一个被当成目标的数字,就不再度量它本该度量的东西了。
要警惕基准的饱和与污染:随着一个基准变老,顶尖模型都挤在天花板附近,细微差异沦为噪声;与此同时,测试题目越来越多地渗进了从网上爬取的训练数据里——在没有真实进步的情况下把分数抬高。一个新鲜的、留出的或对抗性的基准,比一个著名却已被榨干的基准更有价值。