運動與視訊

影片分類

影片分類為「整段片段」指派單一標籤,例如把一段數秒的片段標為「彈吉他」或「跳水」。相對於影像分類,其定義性的挑戰是時間聚合(temporal aggregation):一段影片有數十到數百格,模型必須把跨時間的證據彙整為一個決策,而非評斷單一張圖。

各種方法在「多認真地建模時間」這條光譜上分布不一。最便宜的把影片當成一袋影格:逐格跑一個 2D CNN,再把各格預測平均(後期時間池化),這是個出奇強的基線。較強的時序模型包括循環堆疊(把 CNN 特徵餵進 LSTM)、雙流網路(分開的外觀分支與光流分支)、在空間與時間上做卷積的 3D CNN,以及對時空 token 施加自注意力的現代影片 Transformer(TimeSformer、ViViT、VideoMAE)。標準資料集有 Kinetics(事實上的預訓練集)、Sports-1M 與 Moments in Time。

一個微妙卻核心的問題是場景與外觀偏誤(scene/appearance bias)。對許多基準片段而言,單一張影格幾乎就夠了,因為背景或物體(一座籃球場、一把吉他)不靠任何運動理解就洩漏了標籤。這誘發捷徑學習(shortcut learning):模型靠辨識情境而非動作本身就能拿高分。這正是 Something-Something 資料集被刻意建構成「無法從單格求解」(它要求理解互動的時間方向)的原因,也說明了為何在重外觀的基準上報出漂亮數字,並不能證明模型理解運動。

永遠要問一個「影片」結果是否真的需要影片:在有外觀偏誤的資料集上,單格基線往往幾乎追平完整的時序模型。真正的時序推理最好在 Something-Something 或 Diving48 這類「刻意擊敗單格捷徑」的資料集上展示。