影像分割
互動式分割
互動式分割讓人類保持在迴圈中:系統不是全自動預測遮罩,而是接受人給的幾個廉價提示,據此產生(並精修)遮罩。提示刻意極簡——在物體內部點一下、在背景點一下以把遮罩推回去、畫一筆塗鴉,或框一個方框。目標是用盡可能少的互動達到高品質遮罩,這正是你在標註訓練資料、或編輯一張全自動會太不可靠的相片時所要的。
古典工具是能量最小化方法:GrabCut(矩形加上可選的筆刷)、智慧剪刀/即時連線(Intelligent Scissors / live-wire,游標在你描繪時自動貼齊邊緣)、以及隨機漫步(random walker,從種子像素傳播標籤)。現代深度方法把使用者的點擊作為額外輸入通道餵給網路(常編碼為來自正、負點擊的距離圖),並在每次點擊後預測更新的遮罩;代表系統包括 DEXTR(由四個極值點分割)、f-BRS、RITM,以及以 transformer 為基礎的 SimpleClick。SAM 可視為對同一介面的基礎模型式作法——一次點擊即得一張即時遮罩。
衡量這些方法的標準方式反映了它們的目的:回報達到某目標重疊度所需的點擊次數,例如「達到 90% IoU 的點擊數」(NoC@90),並在資料集上取平均。一個好的互動模型還必須表現得合情合理——每一次修正點擊都應可靠地改善遮罩,而非把它弄亂——這就是為何訓練時的點擊模擬(把下一個點擊放在當前最嚴重的錯誤處)是核心技術。互動式分割是大多數大型遮罩標註工程背後的引擎,因為由人來驗證並微調一個模型,遠比徒手畫出每一條邊界便宜。
標註一隻貓:在牠身上點一個正點擊得到粗略遮罩;在牠後方沙發上點一個負點擊修掉外溢;在牠尾巴上再點一個正點擊補齊遮罩——三次點擊,取代描出數百個邊界點。
又稱