卷積網路架構

網中網(Network in Network)

網中網(Network in Network,Lin、Chen 與 Yan,2013)是一篇短小卻極具影響力的論文,它的想法如今無所不在,儘管這個架構本身鮮少被以原名使用。它的出發觀察是:一般的卷積在每個空間位置上計算的,是局部區塊的一個線性函數再接單一非線性,這是一個相當薄弱的逐位置模型。NiN 提議以一個在每個位置都相同套用的微型多層感知器(multi-layer perceptron)來取代它,一個掃描影像的「微網路」。作者稱之為 mlpconv 層,它讓逐位置的特徵萃取器本身變成非線性、更具表達力。

關鍵的實務領悟是:在每個空間位置獨立套用的多層感知器,恰好等價於一疊 1x1 卷積。1x1 卷積完全不做空間混合;它只是取某一像素上的通道值向量,套用一個學到的線性映射(再接非線性),產生一個新的通道向量。這是 1x1 卷積誕生為一級工具的時刻——能廉價地混合與投影通道、增加或減少其數量、並在不觸動空間解析度的情況下加入非線性容量。後來的每一個架構,包括 Inception 的瓶頸、ResNet 的瓶頸區塊、MobileNet 的逐點卷積、以及壓縮與激發(squeeze-and-excitation),都倚賴這個想法。

NiN 的第二個歷久貢獻是以全域平均池化(global average pooling)取代最終的全連接分類器。它不把最後的特徵圖攤平再過大型稠密層(那是 LeNet、AlexNet 與 VGG 那條參數沉重、易過擬合的尾巴),而是每個類別產生一張特徵圖,然後單純把每張圖平均成一個數字,直接餵入 softmax。這幾乎沒有參數、對過擬合遠為穩健、強制特徵圖與類別之間有乾淨的對應,並能接受可變的輸入尺寸。全域平均池化如今是幾乎每一個現代 CNN 的標準配備,這正是為何 NiN 最好被理解為——不是一個具競爭力的模型,而是整個領域吸收的兩個元件的源頭。

又称
NiN