卷積網路架構

ResNet

ResNet(深度殘差網路,He、Zhang、Ren 與 Sun 於微軟研究院,2015)是把殘差連接的想法拿來、並用以贏得 ILSVRC 2015 的架構,其網路比 VGG 深 8 倍卻仍可訓練。它證明了有了殘差區塊,你可以建構 50、101、152、甚至超過 1000 層的網路,而且——與先前的退化問題相反——更深確實意味著更好。ResNet 橫掃了 2015 年 ImageNet 的分類、偵測與定位任務,並且在十年後的今天,以其眾多變體,依然是整個電腦視覺中最廣為部署的骨幹之一。

ResNet 的原子是殘差區塊:兩到三個卷積層,其輸出透過跳接加回該區塊的輸入,每個卷積後接批次正規化、並使用 ReLU 激活。較深的 ResNet 使用瓶頸區塊——一個降低通道數的 1x1 卷積、一個在縮減後表示上做空間運算的 3x3 卷積、以及一個還原通道數的 1x1 卷積,跳接則繞著這三者相加。這個瓶頸(又是網中網的 1x1 手法)讓極深模型的計算成本維持在可控範圍。網路被組織成數個階段;在每個階段的開頭,空間解析度減半、通道數加倍,並由投影捷徑處理形狀的改變。

ResNet 的重要性難以誇大。它讓深度成為可自由使用的資源,使從業者能夠放心擴展網路,而不必擔心最佳化崩潰。它的設計選擇——批次正規化加殘差區塊加階段式降採樣——成為 ResNeXt、DenseNet(一個對比變體)、SE-ResNet、以及許多偵測與分割系統所立基的模板。尤其是預訓練的 ResNet-50,成為整個領域遷移學習事實上的標準特徵萃取器。即使在 transformer 時代,ConvNeXt 也明確地把一個 ResNet 現代化以追平視覺 Transformer(Vision Transformer),而 ResNet 風格的殘差階段至今仍出現在偵測器、分割器與擴散骨幹之中。

ResNet-50 佈局:一個 7x7 的莖部與最大池化,接著四個階段的瓶頸區塊,分別重複 3、4、6、3 次(因此是「50」個權重層),通道寬度為 256、512、1024、2048;階段之間解析度減半、寬度加倍;全域平均池化加單一全連接層產生 1000 類輸出,全部約 2500 萬個參數。

又稱
Deep Residual NetworkResNet-50ResNet-152