计算机视觉

ImageNet(图像数据集)

/ IM-ij-net /

ImageNet是一个庞大的带标签照片集合——超过一千四百万张图像,每一张都由人工标注出它显示的内容,并被组织进数千个类别,从「金鱼」到「货运车厢」。它由李飞飞领导的团队从2009年起着手构建,背后是一个赌注:计算机视觉所缺的,并不是更聪明的算法,而是足够多的数据。众包工人一张一张地标注这些图像,这项浩大的人力工程,把混乱的互联网变成了一本机器可以研读的教科书。

它的声名来自一年一度的竞赛——ImageNet挑战赛,比赛用的是数据中1000个类别的那一片。2012年,一个叫AlexNet的深度神经网络在比赛中大获全胜,把错误率压低得如此惊人,以至于整个领域几乎一夜之间转向了深度学习。这一个结果,被广泛引为现代AI热潮的火种。此后多年,「ImageNet准确率」一直是衡量视觉进展的那个头条数字。

它也值得一次坦率的清算。ImageNet证明了数据规模能够开启学习,但它同时也埋进了一些问题:有些类别和标签嘈杂或带有冒犯性,照片在国别与文化上有所偏倚,而追逐单一榜单也鼓励了那些「刷榜很高、却在更混乱的真实世界里栽跟头」的模型。所以ImageNet被誉为一个转折点,是恰如其分的——而它作为一则警世故事被研究,说明「数据集的盲区如何变成模型的盲区」,也同样恰如其分。

在2012年的挑战赛中,最好的非深度学习系统在1000类的测试上犯下大约26%的前五错误率。而AlexNet——一个用GPU训练的深度网络——把这个数字降到了约16%,这一跃如此之大,以至于不到一年,几乎每一个认真参赛的项目都成了深度网络。

AlexNet 2012年在ImageNet上的胜利,通常被认为是点燃深度学习时代的那一刻。

日常说的「ImageNet」,通常指那1000个类别的挑战赛子集,而不是完整的一千四百万张图像的数据库。而高ImageNet准确率是必要的,却不是充分的:一个模型可以高居榜首,却依赖背景线索,一碰到与该数据集(偏西方、从网络抓取)风格不同的照片就失灵。

又称
ILSVRCImageNet challenge图像网ImageNet 数据集