運動與視訊

影片物件分割

影片物件分割為影片的每一格產生目標物體的「逐像素精確遮罩」(mask),不只是一個邊界框,而是精確的輪廓,並隨時間追蹤。最具代表性、研究最多的設定是半監督 VOS:你只在第一格獲得真值遮罩,系統必須把該遮罩向前傳播到整段片段,跟隨物體移動、形變與外觀變化。

有三種問題設定。半監督(one-shot)VOS 提供第一格遮罩並加以傳播。無監督 VOS 不給任何遮罩,必須自動發現並分割最顯著的移動物體。互動式 VOS 讓使用者在少數幾格上加塗鴉或點擊,並精修遮罩。方法由「逐影片的線上微調」(OSVOS 在第一格的遮罩上微調一個網路,準確但緩慢)演進到「比對與傳播」,最終形成時空記憶網路(space-time memory networks,STM、STCN):把過去的影格及其遮罩存成一個記憶庫,並透過對該記憶做注意力(像素比對)來分割每一張新影格。近期的 SAM 2 以一個記憶模組統一了可提示(promptable)的影像與影片分割,並立下強勁的新標竿。

標準基準是 DAVIS(高品質、多為單一顯著物體)與 YouTube-VOS(大規模、多物件),以區域準確度 J(遮罩交並比 IoU)與邊界準確度 F(輪廓匹配)評估,通常以 J&F 平均。長期難題包括遮擋與再現、快速運動與運動模糊、劇烈外觀變化,以及多個相似實例的消歧——這些都可能使傳播中的遮罩漂移、滲漏到背景,或對調物體。

只看區域 IoU(J)會獎勵一個大致正確的色塊;真正抓出邊緣草率的是邊界指標(F),這正是 DAVIS 同時報告 J&F 的原因。漂移是無聲的殺手:某一格遮罩的錯誤會變成(錯誤的)參考,污染之後所有影格。

又稱
VOS