膨脹 3D 卷積網路
膨脹 3D 卷積網路(Inflated 3D ConvNet, I3D;Carreira 與 Zisserman,2017)以一個優雅的訣竅解決了 3D CNN 的核心痛點——渴求資料且缺乏良好預訓練:拿一個已在 ImageNet 上訓練好的強力 2D 影像網路,把每個 2D 濾波器沿時間軸複製來「膨脹」成 3D。一個 2D 的 k×k 濾波器變成一個 3D 的 k×k×k 濾波器,其 k 個時間切片都是原濾波器的副本,再除以 k 以讓響應維持校準。如此一來,這個新的 3D 網路便繼承了 2D 網路從數百萬張已標註影像中學到的全部視覺知識,而非從隨機權重起步。
正規化是其精巧之處,並給出一個精確的不變量。由於每個膨脹後的濾波器把它(相同的)副本沿時間平均、又以 1/k 縮放,餵入一段「無聊」的影片——每一格都是同一張靜止影像——時,膨脹後的 3D 網路會產生與「把原 2D 網路套用在那單一張影格上」完全相同的激活值與預測。因此在任何影片訓練之前,I3D 就已表現得像一個稱職的影像模型;在影片上微調(Carreira 與 Zisserman 在當時全新的 Kinetics 資料集上訓練)只需教它額外的時間結構即可。最佳結果結合了兩條膨脹的流(RGB 與光流),即雙流 I3D。
I3D 的影響在於確立了一套該領域至今仍遵循的標準配方:膨脹一個強力的 2D 骨幹、在 Kinetics 上預訓練或共同訓練,再遷移到較小的動作資料集。這種引導法讓 3D 模型既實用又達到最先進水準,而它的後代(SlowFast、X3D)以及後來轉向影片 Transformer,全都建立在 I3D 使之成為主流的「ImageNet/Kinetics 預訓練」這條脈絡之上。
除以 k 的正規化並非裝飾:它正是保證「引導不變量」的關鍵——剛膨脹好的網路在恆定影片上會匹配其 2D 母網路。略過它,繼承的權重就會失準,膨脹的大部分好處也隨之丟失。