卷積網路架構
GoogLeNet
GoogLeNet,又稱 Inception-v1,是贏得 ILSVRC 2014 分類賽道的網路,它證明了你可以同時比對手更深、又遠為高效。由 Google 團隊(Szegedy 等人)打造,它是一個 22 層深的 CNN,藉由堆疊九個 Inception 模組組裝而成,而它的頭條數據令人矚目:它達到比 AlexNet 更好的準確率,卻只使用約 500 萬個參數,約為 AlexNet 六千萬的十二分之一,更遠少於 VGG 的 1.38 億。這個名字是對 LeNet 的刻意致敬,宣示回歸真正以卷積為主、高效的設計,而非當代那些參數沉重的全連接尾巴。
它的高效來自兩個選擇的協同作用。第一,Inception 模組使用 1x1 卷積瓶頸,把多尺度處理的成本壓低。第二,GoogLeNet 完全放棄大型全連接層,在最終分類器之前以全域平均池化取代它們,光這一點就移除了 VGG 與 AlexNet 花在稠密尾巴上的數千萬個參數。結果是一個小到足以實用、又準到足以奪冠的模型,證明了原始參數量並非通往準確率之路,而架構上的巧思是有回報的。
GoogLeNet 也引入了輔助分類器(auxiliary classifier),即訓練時接在網路中段的兩個額外小型 softmax 頭。最初的動機是藉由把額外的梯度訊號注入深網路中段來對抗梯度消失;實務上這些輔助頭結果更像是正規化器(regulariser),並在推論時被移除。一旦批次正規化(在 Inception-v2 引入)與殘差連接讓極深網路預設就可訓練,它們大致就被取代了。因此 GoogLeNet 是第一個把計算效率與準確率並列為一級目標的重要架構,這種態度後來在 MobileNet 與 EfficientNet 中完全綻放。
又稱