運動與視訊

物件追蹤

物件追蹤的意思是:給定目標在第一格的位置(通常是一個邊界框),在隨後每一格都找到「同一個」目標。這種單物件設定刻意做得很泛用——目標可以是任何東西(一張臉、一輛車、一隻動物、一個商標),且僅由那第一個框定義,因此追蹤器無法依賴針對特定類別的偵測器。它的工作是隨時間維持目標的身分與位置,無論世界丟出什麼挑戰。

追蹤器結合兩種互補的線索。外觀(appearance)回答「目標長什麼樣」,透過模板、顏色或特徵直方圖、或學習到的嵌入向量,並與候選位置進行比對。運動(motion)回答「目標下一刻可能在哪」,常是一個簡單的等速度預測,用來縮小搜尋範圍並排除不合理的跳動。訣竅在於兩者的融合:只靠外觀會漂移到長得像的東西上,只靠運動則會跟丟正在變向或短暫被遮擋的目標。

核心難題是漂移(drift):每格微小的定位誤差,以及目標模型任何被污染之處,會不斷累積,直到追蹤器鎖到背景上。這造就了「穩定性—可塑性兩難」(stability-plasticity dilemma):外觀模型要更新得夠快以跟上形變、尺度變化與光照,但又不能快到把遮擋物吸收進模型。範式由生成式(找出與模板最匹配的影像塊)演進到判別式(線上訓練一個分類器把目標與背景分開),再到深度追蹤器:Siamese 網路(SiamFC、SiamRPN)離線學習一個相似度函數、以交叉相關進行定位;以及 Transformer 追蹤器(TransT、STARK、OSTrack)在模板與搜尋區域之間做注意力。進展以 OTB、VOT 挑戰賽,以及大規模的 LaSOT、GOT-10k 衡量。

追蹤不等於「逐格偵測」:一個與類別無關的追蹤器必須跟隨僅由第一格定義的任意實例,且不該被偵測器「重置」。反過來說,從不重新偵測的天真追蹤器在長時間遮擋後無法復原,這也是現代系統會加入重偵測或驗證模組的原因。

又称
visual object trackingVOTsingle object trackingSOT