卷積神經網路
平均池化
平均池化藉由「取平均值而非最大值」來摘要每個視窗。最大池化問的是「這裡單一最強的回應是什麼?」,平均池化問的則是「這個區域的典型回應是什麼?」。它融合視窗內的每一個值,因此一個廣泛出現的特徵即使沒有任何單一像素飆高,也會產生很高的平均值,而孤立的雜訊尖峰則被稀釋。結果是更平滑、更低對比的降採樣。
精確地說,對一個覆蓋含 n 個位置之集合 R 的視窗,平均池化逐通道輸出 (1/n) 乘以 R 中所有 (i,j) 的 x[i,j] 總和。在反向傳播時,梯度被平均分配——視窗內每個位置都收到入流梯度的 1/n——這與「把一切都路由到單一位置」的最大池化不同。這種稠密且均勻的梯度讓平均池化很穩定,這也是現代網路在最終空間塌縮時偏好它的原因之一。
平均池化作為網路中段運算曾經失寵(最大池化能為分類給出更銳利的特徵),但它在兩個現代場景中很關鍵。網路 head 的全域平均池化(ResNet、Inception)把每整張特徵圖平均成一個數字,取代了參數沉重的全連接層。而平均式的池化也是平滑多尺度模組與某些注意力池化的基礎。相較於最大值的取捨是:取平均保留了一個區域整體的能量/脈絡,但可能把一個小而重要的顯著特徵沖淡。
對同一個 2x2 區塊 [ [1, 7],[3, 2]] 做平均池化輸出 (1+7+3+2)/4 = 3.25,反向傳播時四個位置各收到上游梯度的 1/4。
為何重要:平均對最大是一種「偏好」的選擇。當整個區域的內容都重要時(紋理、整體脈絡、最終分類 head)用平均;當銳利特徵的峰值/是否存在才重要時(邊緣、部件)用最大。許多網路會刻意在不同階段混用兩者,而非死守其一。