影像分割

Mask R-CNN

Mask R-CNN 是實例分割「先偵測再分割」的經典模型,概念上只是在偵測器上做了極小的加法。先看 Faster R-CNN,它分兩階段找物體:區域提議網路(region proposal network)提出候選方框,接著一個頭部對每個方框分類並修正其座標。Mask R-CNN 出自 He、Gkioxari、Dollár 與 Girshick(2017),只是再加掛第三個並行分支,在每個偵測到的方框內預測一張二值遮罩。偵測與遮罩同時發生,共用同一個骨幹特徵。

它最重要的技術貢獻是 RoIAlign,修正了早期 RoIPool 一個微妙卻有害的瑕疵。為了從一個浮點數方框擷取固定尺寸的特徵網格,RoIPool 把座標捨入成整數兩次,使特徵與像素錯位達數個像素之多——對寬鬆的方框尚可容忍,對像素級精確的遮罩卻是災難。RoIAlign 去除所有捨入,改用雙線性內插(bilinear interpolation)在精確的浮點位置採樣特徵值,恢復了俐落遮罩所要求的對齊。

另有兩個設計選擇很重要。遮罩分支是一個逐區域套用的小型全卷積網路,通常產生一張 28×28 的遮罩,再縮放到方框大小。關鍵在於:遮罩與分類解耦——該分支為每個類別各預測一張二值遮罩,由分類分支決定保留哪個類別的遮罩。這避免了類別之間的競爭,且已證明優於預測單一個「知道類別」的遮罩。搭配 ResNet-FPN 骨幹(特徵金字塔網路 Feature Pyramid Network 處理多種物體尺度),Mask R-CNN 長期成為 COCO 實例分割的強勁基準,並能自然延伸到人體姿態估計,做法是預測關鍵點的「遮罩」。

RoIAlign 是人們最常重新推導的部分:教訓是量化(把方框座標捨入)在偵測度量上看不出來,卻會明顯劣化遮罩品質。任何像素級精確的裁切都應使用次像素(sub-pixel)採樣。