特徵與描述子

尺度空間

同一個物件在影像中可能顯得大或小,取決於它有多遠,而在某個大小下顯而易見的特徵,在另一個大小下卻看不見:樹皮的紋理近看是細節,但從田野另一頭看就化成一片均勻的褐色。尺度空間(scale space)正是「我該在什麼大小下觀看?」這個問題的系統性答案。它不是單一張處理過的影像,而是一整個以尺度參數為索引的影像家族,其中細微的細節隨著模糊增加而逐步被移除。從清晰讀到模糊,就像從場景往後退步:小結構最先淡去,大結構則持續存在。

具體而言,影像的高斯尺度空間(Gaussian scale space)是透過以標準差遞增的高斯濾波器與之卷積而得。標準差就是尺度:在尺度為零時你有原始影像,而當它增大,影像就被平滑得越來越多。關鍵在於,高斯平滑是唯一能建構出滿足自然公設之尺度空間的線性運算:增加尺度永遠不會創造新結構(隨著模糊,不會憑空冒出新的局部極值),這個表示在位移與旋轉下行為一致,且兩個平滑步驟的合成等同於一個更大的步驟。這些由 Witkin、Koenderink、Lindeberg 等人得出的結果,把高斯挑選為恰當的平滑核,而非任意的選擇。

其回報是尺度不變的特徵偵測。要不論特徵在影像中多大都能找到它,就不只在空間位置上搜尋,也在尺度上搜尋,並挑出同時在兩者皆為極值的位置;反應出現峰值的尺度,就是該特徵的內在大小。為了讓不同尺度的反應可比較,導數運算子必須做尺度正規化(例如把拉普拉斯乘以尺度的平方),因為原始導數會隨影像被模糊而縮小。這正是斑點偵測器與 SIFT 所做的:SIFT 建立一個離散尺度空間,組織成八度(octave,每個八度涵蓋尺度的一次加倍,八度之間影像下採樣一半以求效率),並把關鍵點偵測成該空間中高斯差的極值。

尺度空間不只是 SIFT 的一個實作細節;它是多解析度視覺的基礎原理。影像金字塔(image pyramid),從光流到現代物件偵測器中的特徵金字塔網路(feature-pyramid network)無處不用,就是一個取樣後的尺度空間。即便是卷積網路,也隨著感受野隨深度增長而隱含地建構出一個學習式的多尺度表示。理解尺度空間能解釋為何單一固定大小的濾波器不可能尺度不變,以及為何幾乎每個穩健的特徵流程都在多個解析度上處理影像。

為什麼非高斯不可?因為在線性設定下,只有高斯能保證「尺度增加不產生新結構」(因果性)這項性質。用方框模糊或中值濾波來建構「尺度空間」可能會製造或位移極值,破壞你原本想取得的不變性。

又稱
scale-space representationGaussian scale space