影像分割

空洞空間金字塔池化

空洞空間金字塔池化(Atrous Spatial Pyramid Pooling,ASPP)是讓 DeepLab 中單一層能一次感知多種尺寸物體的模組。它要解決的問題是:近處的車佔滿畫面,遠處的車只有幾個像素,但兩者都應被標為「汽車」。固定的感受野對其中之一必然是錯的。ASPP 的答案是同時透過數個不同寬度的窗口觀看同一張特徵圖,再把各自所見融合起來。

在機制上,ASPP 對同一個輸入並行套用數個空洞(擴張)卷積,每個有不同的擴張率——例如在輸出步幅 16 時用 6、12、18。小擴張率看見精細的局部結構;大擴張率以相同數量的權重橫跨寬廣脈絡,因為卷積核被拉開、中間留空隙。DeepLabv3 在這個金字塔上再加一個普通的 1×1 卷積(率為 1)與一個影像層級的全域平均池化分支,後者注入整個場景的脈絡。所有分支被串接,再由最後一個 1×1 卷積融合成輸出特徵。

其名稱拆解出它的血脈:「atrous」(法文 à trous,「帶孔」)即擴張卷積;「空間金字塔池化」則是借自早期辨識研究的想法——在多個尺度探查一個表徵並把結果池化。ASPP 把兩者結合,使多尺度探查在每一個空間位置上稠密地進行,這正是稠密的逐像素預測所需要的。

一個 3×3 卷積核在擴張率 6 下覆蓋 13×13 的區域(有效尺寸 = 3 + 2×(6−1)),卻仍只用 9 個權重——寬廣脈絡、零額外參數。

又称
ASPP