影像分類
影像分類 (image classification)
影像分類是電腦視覺最具代表性的任務:把一整張影像指派到一個預先定義好的固定類別清單中的某一個類別,在多標籤的版本中則是指派到一組類別。輸入是單一張影像,也就是一個像素的網格,通常帶有三個色彩通道;輸出是一個標籤,例如「貓」、「消防車」或「黑色素瘤」。關鍵在於,分類回答的是整張畫面層級的「這張影像裡有什麼?」;它不會說出物體在哪裡(那是偵測),也不會說出哪些像素屬於該物體(那是分割)。
形式上,我們學習一個函數 f,它把影像 x 對應到 C 個類別上的一組分數向量,再由一個決策規則(幾乎總是 argmax)挑出預測類別。訓練使用由(影像、類別)配對組成的有標註資料集,並調整模型參數使預測類別盡可能常常與真實標籤一致。現代系統把 f 實作為一個深度神經網路,過去是像 ResNet 這樣的卷積網路,如今則常是視覺 Transformer,最後接上一個線性的分類頭,為每個類別輸出一個分數。
影像分類的重要性遠超出它自身的應用,因為它是視覺表徵學習的主力預訓練任務:一個被訓練去分類 ImageNet 的網路會學到通用特徵,可遷移到偵測、分割、檢索等任務。它也是研究幾乎所有深度學習概念最單純的場景,包括最佳化、正規化、校準、強健性與公平性,這正是本領域許多術語都圍繞它來闡述的原因。
初學者常見的混淆是把分類當成能定位物體。如果一張影像同時含有狗和腳踏車,單標籤分類器仍必須只挑出一個標籤;要處理多個物體需要多標籤分類、偵測或分割,而不是標準的單標籤分類器。
又称