影像分類
ImageNet 資料集
ImageNet 是一個大規模、由人工標註的影像資料庫,對現代影像分類的塑造勝過任何其他單一資源。完整的資料庫依照 WordNet 名詞階層組織了超過一千四百萬張影像,但實務上「ImageNet」幾乎總是指 ImageNet 大規模視覺辨識挑戰賽(ILSVRC)所使用的子集:大約 128 萬張訓練影像,涵蓋 1000 個互斥的物體類別,另有 5 萬張驗證影像與 10 萬張測試影像。
它的重要性兼具歷史與實務意義。2012 年的冠軍 AlexNet 用一個在 GPU 上訓練的深度卷積網路大幅降低了前 5 錯誤率,這個結果被廣泛認為點燃了視覺領域的現代深度學習時代。自此之後,ImageNet 的前 1 準確率便成為事實上的排行榜,用來比較 VGG、ResNet、EfficientNet 與視覺 Transformer 等架構,以及它們的訓練配方。
除了作為基準之外,ImageNet 還是預設的預訓練語料:一個被訓練去分類 ImageNet-1k 的網路,其權重會被當作無數下游任務的初始化重複使用。請留意它有記錄在案的限制,包括標籤雜訊、較大階層中某些含糊或冒犯性的類別,以及照片在地理與文化上的偏差,因為這些都可能傳遞到任何以它預訓練的模型中。
「ImageNet 準確率」這個說法在沒有指明資料切分(驗證集還是保留的測試集)與版本(1000 類的 ImageNet-1k,還是常用於大規模預訓練、約 21000 類的 ImageNet-21k)時是含糊的。不同版本得出的數字並不可相互比較。
又称