ConvNeXt
ConvNeXt(Liu 等人,Facebook AI 研究院,2022)是一個純卷積網路,設計來回答一個在視覺 Transformer(Vision Transformer,ViT)看似超越 CNN 之後被尖銳提出的問題:transformer 的自注意力(self-attention)機制是否真的是其更優準確率的功臣,還是隨 transformer 一同打包而來的眾多其他現代訓練與設計選擇?作者從一個標準的 ResNet-50 出發,逐步把它現代化,一步一步採納 ViT 與 Swin Transformer 所推廣的設計與訓練配方,同時讓網路保持完全卷積,並在每一步量測準確率的提升。其結果 ConvNeXt 在 ImageNet 與下游任務上追平或超越了可比的視覺 Transformer。
這些現代化步驟之所以富啟發性,正是因為沒有一個是奇特的。訓練配方被升級(更長的排程、AdamW 最佳化器、Mixup 與 RandAugment 等強力擴增、隨機深度、標籤平滑)。宏觀設計借自 transformer:一個「分塊」(patchify)莖部,以一個 4x4、步幅 4 的卷積把影像切成不重疊的小塊,並調整各階段的計算比例以匹配 Swin。微觀設計則採用大的 7x7 深度卷積(呼應自注意力寬廣的感受野)、一個如 MobileNetV2 與 transformer 前饋區塊的反向瓶頸、遠少得多的激活與正規化層、以 GELU 取代 ReLU、以 LayerNorm 取代 BatchNorm。每個改動加上零點幾個百分點,合起來就抹平了與 transformer 的差距。
ConvNeXt 的重要性,在修辭上不亞於在架構上。它提供了有力的證據:視覺 Transformer 的優勢有很大一部分來自訓練方法論與宏觀架構選擇,而非自注意力在根本上是必要的,從而證明一個妥善現代化的純 CNN 仍極具競爭力。這把「CNN 對 transformer」的辯論,從一個二元對立重新框定為一種趨同:這兩個家族已大量互相借鑑。後續的 ConvNeXt V2(2023)加入了一套全卷積的遮罩自編碼器(masked autoencoder)自監督預訓練方案與一個全域反應正規化層,進一步改善了結果。ConvNeXt 如今是現代視覺流程中一個標準的強力基線骨幹。
ConvNeXt 的警世教訓是關於公平歸功:當一個新模型勝過舊模型時,那個頭條機制(這裡是自注意力)未必是真正的原因。受控、漸進的消融——一次只改一件事——才是把訓練技巧與架構實質分開的辦法。