影像分割
影像分類(image classification)用一個標籤回答「這張圖裡有什麼?」。物件偵測(object detection)更進一步,為每個物體畫出方框。影像分割則一路深入到最細的單位:為每一個像素(pixel)都指派一個標籤。可以想像一本著色本,機器不但要找出輪廓在哪裡,還要為每個區域填上正確的顏色。輸出不是一句話或一個方框,而是一張與輸入同樣寬高的全解析度地圖,地圖上每個位置都帶有意義。
精確地說,把影像看成一個像素網格。分割會產生一張空間尺寸完全相同的標籤圖(label map,也稱為遮罩 mask),其中每個像素的值就是它被預測的類別或物件身分。由於是「每個像素一個預測」而非「整張圖一個預測」,這稱為稠密預測(dense prediction)。此任務分為三大類:語意分割(semantic segmentation,每個像素一個類別,例如「道路」「汽車」)、實例分割(instance segmentation,把同類別的不同物體個別分開)、以及全景分割(panoptic segmentation,兩者同時做到)。此外還有源遠流長的非監督式區域分群傳統,僅依顏色、紋理或亮度把像素分群,而不帶任何學習得到的類別名稱。
核心難題在於脈絡(context)與解析度(resolution)之間的張力。要判斷一團灰色是「道路」而非「天空」,你需要很大的視野(脈絡),深度網路藉由反覆下採樣(downsampling)來取得;但下採樣會丟掉你做出俐落邊界所需的精確像素位置。幾乎所有現代架構(全卷積網路、U-Net、DeepLab、PSPNet,以及 SegFormer、Mask2Former 等 transformer 模型)都是對這同一個張力的回應。其他反覆出現的挑戰還包括:物體以多種尺度出現、嚴重的類別不平衡(巨大背景中一顆微小腫瘤)、以及模稜兩可的邊界。
品質是以重疊度量而非單純的準確率來衡量,因為大多數像素都是容易的背景,會讓任何天真的分數虛高。標準度量為交集比聯集(Intersection-over-Union,IoU,又稱 Jaccard 指數)、Dice 係數,以及針對有排序的實例輸出的遮罩平均精度(mask Average Precision)。本領域其餘術語都是以這些標尺來互相比較的。
單純的像素準確率是個陷阱:若 95% 的像素是背景,一個處處預測「背景」的模型就能拿到 95% 分數,卻什麼都沒找到。請務必對前景類別回報 IoU 或 Dice。