運動與視訊

多物件追蹤

多物件追蹤(MOT)同時跟隨許多目標,且至關重要地為每個目標指派一個貫穿整段影片、持續不變的身分(ID),即便物體進場、離場、彼此交錯、躲到對方後面也是如此。輸出不只是每格的框,而是一組軌跡:「7 號人」從第 1 格到第 900 格都是同一個人。在遮擋與雜亂中維持 ID 穩定,正是讓 MOT 真正困難之處,遠超過「在每格偵測物體」本身。

主流範式是「以偵測為基礎的追蹤」(tracking-by-detection):在每一格上執行物件偵測器,再做資料關聯(data association)把新偵測連結到既有軌跡。關聯為每一個「偵測—軌跡」配對打分,依據運動一致性(偵測是否落在卡爾曼濾波器預測之處?)與外觀相似度(是否匹配該軌跡學到的嵌入向量?),再用匈牙利演算法(Hungarian algorithm)最佳地求解全域指派。這條脈絡很有啟發性:SORT 只用 IoU +卡爾曼+匈牙利,極為快速;DeepSORT 加入深度重識別(re-identification)嵌入,使 ID 能撐過短暫遮擋;ByteTrack 的洞見是「連低信心偵測也拿來關聯」(這些往往是部分被遮擋的物體)而非丟棄,大幅減少跟丟。端到端的 Transformer 追蹤器(TrackFormer、MOTR)以「軌跡查詢」(track query)把偵測與關聯摺進單一網路。

評估本身自成一門學問,因為有兩種失效模式要權衡:偵測誤差(漏檢、誤檢)與關聯誤差(ID 互換,即兩條軌跡交換標籤,以及軌跡斷裂)。MOTA 偏重偵測,IDF1 偏重身分維持,而現代的 HOTA 指標則明確地把偵測準確度與關聯準確度拆解並加以平衡。標準基準是 MOTChallenge(MOT16/17/20,人群中的行人),以及駕駛場景的 KITTI/BDD100K。反覆出現的大敵是擁擠場景、長時間遮擋,以及視覺上完全相同的目標(一群穿著相似的人)。

一次 ID 互換在逐格偵測指標上代價很小,卻會毀掉下游分析(計數、軌跡分析),這正是 HOTA 與 IDF1 存在的原因。ByteTrack 證明了多數流程當作「垃圾」丟棄的低信心偵測,往往是真實的被遮擋物體,把它們找回來能防止 ID 互換。

又称
MOTmultiple object tracking