卷積神經網路

最大池化

最大池化藉由「只保留視窗中的最大值」來摘要每個視窗。由於特徵圖的值衡量的是「這個特徵在這裡出現得有多強」,取最大值回答的就是「這個特徵在這個視窗內任何地方有沒有出現?在它最強處有多強?」。這是「最強證據」規則:一個有把握的偵測會存活下來,微弱的背景回應則被丟棄。這讓最大池化天生適合「不論確切位置、偵測顯著特徵是否存在」。

精確地說,對一個覆蓋位置集合 R 的視窗,最大池化逐通道輸出 R 中所有 (i,j) 的 x[i,j] 之最大值。在反向傳播時,梯度只會流向當初持有最大值的那一個位置(即「argmax」);視窗內其他每個位置都收到零梯度。這種路由意味著最大池化的梯度是稀疏的,在某一筆範例上可能讓許多單元沒被更新,但它傾向產生銳利、高對比的特徵回應。

最大池化主宰了經典 CNN 時代(LeNet、AlexNet、VGG 都用 2x2 最大池化),正是因為邊緣與部件是那種「有或沒有」的特徵,峰值才是重點。它的弱點在於不可逆且過度自信——它忽略了視窗內激活值的分布——因此在現代設計中正逐漸被帶步幅的卷積(可學習、沒有硬性 argmax)取代,而最終聚合則改用平均或全域池化。

對 2x2 區塊 [ [1, 7],[3, 2]] 做最大池化輸出 7;反向傳播時,上游梯度只送到當初持有 7 的位置,而 1、3、2 都收到零。

反向傳播的細節:由於梯度只路由到 argmax,平手以及最大值在不同迭代間的移動,會讓最大池化後的特徵不如平均池化的平滑。此外,最大池化對離群值/雜訊尖峰很敏感——單一個又亮又雜的像素就會贏得整個視窗。