影像分割
金字塔場景解析
金字塔場景解析網路(Pyramid Scene Parsing Network,PSPNet)是一個語意分割模型,建立在單一觀察上:許多標記錯誤源於沒看到全局。一個網路可能因為只看局部、形狀模稜兩可,而把船叫成車——但若它知道這艘船位於水面上,正確答案便顯而易見。PSPNet(Zhao 等人,2017)藉由在做逐像素決策之前,明確地在數個空間尺度(含整張影像的尺度)聚合脈絡,來修正這點。
它的關鍵元件是金字塔池化模組(pyramid pooling module)。取骨幹(一個擴張版 ResNet)產生的特徵圖,並行地把它池化成數個粗糙網格——例如 1×1(整個場景的單一全域描述子)、2×2、3×3、6×6(越來越局部的子區域)。每個池化後的網格經過一個 1×1 卷積以降低通道數,再上採樣回原始特徵圖尺寸,然後全部串接到原始特徵上。結果是一個表徵:每個像素現在同時帶有其子區域、其更大區域、以及整張影像的摘要。
這種多尺度的全域脈絡正是 PSPNet 與 DeepLab 的 ASPP 的區別所在:ASPP 以並行的擴張卷積探查脈絡(在固定池化下變化感受野),而 PSPNet 以並行池化到固定網格尺寸來探查(變化空間摘要的粒度)。PSPNet 贏得 2016 年 ImageNet 場景解析挑戰賽,並在 ADE20K 與 Cityscapes 上取得強勁成績,其金字塔池化的想法成為脈絡聚合的標準構件。
又稱