運動與視訊

動作辨識

動作辨識是影片理解的旗艦案例:辨識一個人(或一群人)正在做什麼,例如「跳躍」、「握手」或「開門」。它本質上是專門針對人類活動的影片分類,對許多研究者而言這兩個詞幾乎可互換使用,因為動作基準推動了影片模型的大部分進展。

區分三種常被混為一談的任務設定很重要。修剪過的片段分類(trimmed clip classification)假設影片已含一個動作,只需把它命名。時序動作偵測/定位(temporal action detection/localization)在未修剪影片上運作,必須同時說出「發生什麼動作」與「在何時」(其起訖時間)。時空動作偵測(如 AVA 基準)走得更遠,在空間與時間中定位行為者,產生一條框的「管」(tube)加上一個標籤。較難的設定需要尊重時間順序的運動建模:若不知道運動方向,就無法區分把抽屜「打開」還是「關上」——這正是只靠外觀的模型失敗之處。

方法與影片模型的時間線相互對應:雙流網路、3D CNN 與 I3D、SlowFast 網路(一條慢速高解析度的外觀路徑,加一條快速低解析度的運動路徑),以及影片 Transformer。另一個獨立家族是以骨架為基礎的辨識(ST-GCN 及其後繼者),它先擷取人體姿態,再對關節執行圖卷積,以「需要可靠的姿態估計」為代價,換取對背景與外觀的穩健性。核心基準包括 UCF101 與 HMDB51(較舊、重外觀)、Kinetics-400/600/700、Something-Something(時序推理)、AVA(時空),以及 Charades(多標籤的日常活動)。

把「辨識」(為修剪片段中的動作命名)與「偵測/定位」(在未修剪影片中找出何時何地)混淆,會導致比較不可比的數字。真實世界的部署幾乎總是需要定位版本,而它遠不如修剪片段準確度所暗示的那般成熟。