影像分割
語意分割
語意分割為每個像素塗上它所屬類別的名稱,到此為止。若一個街景中有三輛車,它們所有的像素都會被塗成單一顏色「汽車」——這個方法並不在意那其實是三輛分開的車輛。它回答「這個像素上是哪一種東西?」,卻從不回答「這是哪一個特定物體?」。
形式上,你先選定一組固定的類別(例如天空、道路、建築、行人、汽車)。網路為每個像素輸出一個跨這些類別的機率分布;取機率最高的類別即得到最終的標籤圖。訓練時最小化一個逐像素損失——通常是交叉熵(cross-entropy),並常搭配如 Dice 這類區域重疊損失以對抗類別不平衡。標準的基準度量是平均交集比聯集(mean IoU,mIoU):對每個類別計算預測遮罩與真實遮罩之間的 IoU,再跨類別取平均,使稀有類別與常見類別同等重要。
其架構血脈始於全卷積網路(第一個端對端設計),歷經 U-Net、SegNet 等編碼器-解碼器模型,再到脈絡密集的設計如 DeepLab(空洞卷積、ASPP)與 PSPNet(金字塔池化),如今則有以 transformer 為基礎的模型如 SegFormer 與統一框架 Mask2Former。它們全都在與同一個「脈絡對解析度」的問題搏鬥:擷取足夠的周遭場景以正確標記某像素,同時保持邊界俐落。
語意分割無法計數。若你的應用需要知道「有幾輛車」,就得改用實例或全景分割——語意遮罩會把相鄰的同類別物體合併成一團。