Xception
Xception(Chollet,2017,Keras 的作者)是對 Inception 模組的重新詮釋,把它底層的假說推到極限,因此得名「極致 Inception」(Extreme Inception)。Inception 模組隱含地假設特徵圖中的跨通道相關與空間相關可以某種程度上分開映射:它的 1x1 卷積先混合通道,然後它的 3x3 與 5x5 分支處理空間結構。Xception 問道:如果我們假設這兩種相關是完全解耦的、可以在完全分離的步驟中處理呢?把這個假設貫徹到底,就把 Inception 模組變成了深度可分離卷積。
具體而言,Xception 是一疊深度可分離卷積:一個處理所有跨通道混合的 1x1 逐點卷積,後接一個逐通道獨立處理空間濾波的深度卷積。這幾乎與 MobileNet 所用的基本元件相同,只有兩處次要的順序與細節差異(Xception 先套用 1x1,且通常在兩個運算之間不放非線性)。整個網路由這類區塊構築,組織成進入流、中段流與離開流,並在大多數區塊外圍包上殘差連接以協助最佳化,得到與 Inception-v3 大致相同的參數量、卻有更好的準確率。
Xception 的意義在於概念上的清晰:它把深度可分離卷積定位成不只是個效率技巧,而是一個關於影像特徵結構的有原則的架構假說,亦即「分開學習通道混合與空間混合不只更便宜、往往也更好」。藉由在 ImageNet 上以相近的尺寸勝過 Inception-v3,它驗證了這個假說,並協助把深度可分離卷積鞏固為一個預設的構築區塊。因此 Xception 處於 Inception 路線(多尺度、分解模組)與 MobileNet/EfficientNet 路線(高效可分離卷積)之間的概念交會點。
別因為兩者都使用深度可分離卷積就把 Xception 等同於 MobileNet。Xception 是一個源自 Inception 的大型、高準確率的伺服器級網路,而 MobileNet 使用同樣的基本元件來追求裝置上的最小延遲;相同的構築區塊,相反的設計目標。