影像分類

基準影像資料集 (benchmark image datasets:CIFAR / MNIST)

除了 ImageNet 之外,還有一小群標準資料集擔任分類想法的試驗場,之所以受重視,是因為它們小到可以在幾分鐘內反覆實驗,卻又豐富到足以揭露不同方法之間的真實差異。MNIST 含有 7 萬張 28×28 的灰階手寫數字影像,分為 10 個類別;它是影像分類經典的「Hello World」,如今簡單到強模型可超過 99% 準確率,已不太能區分好方法之間的優劣。

CIFAR-10 與 CIFAR-100 各含有 6 萬張 32×32 的微小彩色照片,分別切分成 10 個粗類別(飛機、狗、船等等)與 100 個較細的類別。它們是原型化架構、擴增方案與正規化手法的主力基準,因為完整的一次訓練在單一 GPU 上於合理時間內即可完成,而 CIFAR-100 每類樣本較少,使得過度擬合與類別混淆易於研究。

善用這些基準意味著尊重它們的慣例:在官方測試切分上回報結果、絕不在其上調參,並記住在微小低解析度影像上得到的結論,不一定能遷移到像 ImageNet 那樣的高解析度、大量類別場景。它們是快速、受控比較的工具,而非真實世界效能的證明。

由於這些資料集被大量重複使用,已發表的最先進數字有可能累積了整個社群在測試集上微妙的過度擬合。對 CIFAR-10 上一個百分點的提升要抱持健康的懷疑,並偏好那些在更難、尚未飽和的基準上也能改善的方法。

又稱
MNISTCIFAR-10CIFAR-100