電腦視覺

實例分割(instance segmentation)

/ IN-stuns seg-men-TAY-shun /

實例分割是日常視覺任務裡要求最高的一種:它為每一個獨立的物體生成一張像素級精確的遮罩——也就是精確的輪廓——並且即便它們屬於同一類別,也要把它們一一區分開。想像三隻相互重疊的羊:實例分割會輸出三張各自獨立的遮罩,一羊一張,每張都描出那隻動物精確的輪廓。它是偵測(有哪些物體、在哪裡)與分割(精確形狀)的融合,還額外具備了數數和區分個體的能力。

可以把它看作兩個早先想法的合併。目標偵測為每個物體給一個框,能數出數量,但框只是個粗糙的矩形。語義分割給出精確的像素輪廓,卻把同類物體併成一團。實例分割則同時做到兩者:這個像素是「人」,而且具體是「第二個人」。最有名的方法Mask R-CNN,乾脆在Faster R-CNN偵測器上加裝一個預測遮罩的分支——先找到每個物體,再塗出它精確的形狀。

它驅動著那些必須把單個物體乾淨地分離出來的任務:機器人從雜亂料箱裡抓取某一件、在顯微鏡切片上數細胞、為交通分析把每輛車分開,或是把照片裡的某個人摳出來。誠實地說,代價很高。訓練數據貴得嚇人——得由人工一筆一筆描出每個物體的輪廓——而且模型比單純的偵測更笨重、更慢。在相互接觸、長得又像的物體之間,那條邊界,始終是錯誤最容易鑽進來的地方。

一台倉庫機器人朝一箱完全相同的盒子裡看。實例分割為每個盒子返回一張獨立的遮罩——盒子1、盒子2、盒子3——每張都精確勾出輪廓,於是機械爪能準確知道一個盒子在哪兒結束、下一個從哪兒開始,即使它們彼此重疊。

同一類別,但每個物體各有自己的遮罩——偵測、精確形狀與計數三者合一。

實例分割往往就是人們想像中「AI看見物體」真正應該有的樣子——但它是標註和運行成本最高的任務之一。還有一種全景分割(panoptic segmentation),它把針對可數物體的實例遮罩,與針對天空、道路這類無定形物質的語義區域,結合在一起。

又稱
实例分割實例分割object mask predictionMask R-CNN