電腦視覺

ImageNet(圖像資料集)

/ IM-ij-net /

ImageNet是一個龐大的帶標籤照片集合——超過一千四百萬張圖像,每一張都由人工標註出它顯示的內容,並被組織進數千個類別,從「金魚」到「貨運車廂」。它由李飛飛領導的團隊從2009年起著手構建,背後是一個賭注:電腦視覺所缺的,並不是更聰明的演算法,而是足夠多的數據。眾包工人一張一張地標註這些圖像,這項浩大的人力工程,把混亂的網際網路變成了一本機器可以研讀的教科書。

它的聲名來自一年一度的競賽——ImageNet挑戰賽,比賽用的是數據中1000個類別的那一片。2012年,一個叫AlexNet的深度神經網路在比賽中大獲全勝,把錯誤率壓低得如此驚人,以至於整個領域幾乎一夜之間轉向了深度學習。這一個結果,被廣泛引為現代AI熱潮的火種。此後多年,「ImageNet準確率」一直是衡量視覺進展的那個頭條數字。

它也值得一次坦率的清算。ImageNet證明了數據規模能夠開啟學習,但它同時也埋進了一些問題:有些類別和標籤嘈雜或帶有冒犯性,照片在國別與文化上有所偏倚,而追逐單一榜單也鼓勵了那些「刷榜很高、卻在更混亂的真實世界裡栽跟頭」的模型。所以ImageNet被譽為一個轉折點,是恰如其分的——而它作為一則警世故事被研究,說明「數據集的盲區如何變成模型的盲區」,也同樣恰如其分。

在2012年的挑戰賽中,最好的非深度學習系統在1000類的測試上犯下大約26%的前五錯誤率。而AlexNet——一個用GPU訓練的深度網路——把這個數字降到了約16%,這一躍如此之大,以至於不到一年,幾乎每一個認真參賽的項目都成了深度網路。

AlexNet 2012年在ImageNet上的勝利,通常被認為是點燃深度學習時代的那一刻。

日常說的「ImageNet」,通常指那1000個類別的挑戰賽子集,而不是完整的一千四百萬張圖像的資料庫。而高ImageNet準確率是必要的,卻不是充分的:一個模型可以高居榜首,卻依賴背景線索,一碰到與該資料集(偏西方、從網路抓取)風格不同的照片就失靈。

又稱
ILSVRCImageNet challenge图像网ImageNet 数据集