影像處理與濾波

影像金字塔

影像金字塔是同一影像在解析度逐級變粗下的一疊副本,底部是全尺寸影像,往上是半尺寸版本、四分之一尺寸,依此類推,像一座向頂端收窄的金字塔。建立它的理由是:不同尺度看得見不同的東西,一張臉在小縮圖中一目了然,但個別毛孔需要全解析度。由粗到細地處理,先在小影像上廉價地找到粗略答案,再在較大影像上精修,能讓許多任務更快、更穩健,並給演算法一個掌控尺度的把手。

主要有兩種。高斯金字塔的建法是反覆對影像做高斯模糊、再以二倍因子降採樣;每一層 G(l+1) = downsample(blur(G(l)))。模糊是必要的,它移除高頻,否則在丟棄像素時這些高頻會混疊(alias)成難看的瑕疵。拉普拉斯金字塔則改為儲存每一步所失去的細節:每一層 L(l) = G(l) 減去 G(l+1) 經上採樣與模糊後的版本,這是一張帶通影像,捕捉該尺度有、而下一尺度沒有的頻率。拉普拉斯金字塔是可逆的,你可把各層加回去精確重建原圖,這正是它能作為編輯與壓縮之多尺度分解的原因。

影像金字塔無所不在。Burt-Adelson 的拉普拉斯金字塔融合能無縫合併兩張照片(經典的蘋果橘子拼接)。由粗到細的光流先在小影像上估計大幅運動以追蹤之。SIFT 建立高斯模糊八度(octave)的尺度空間,並在跨尺度的高斯差中尋找極值作為關鍵點,給出尺度不變特徵。在深度學習中,特徵金字塔網路(FPN)融合多解析度的 CNN 特徵圖,使偵測器能同時找到大物件與小物件。代價不大:完整金字塔僅比原圖多約三分之一的儲存。

要把眼睛照片融合到手掌上,為兩者各建拉普拉斯金字塔、為遮罩建高斯金字塔,依遮罩權重逐層融合再塌縮,接縫便消失了,因為每個頻帶都在與其尺度相稱的寬度上被融合。

陷阱:你必須在降採樣前先模糊。略過模糊而僅僅每隔一個丟棄像素會造成混疊,鋸齒邊緣與摩爾紋,因為高頻會折返成虛假的低頻,而後續任何步驟都無法復原。

又称
Gaussian pyramidLaplacian pyramidmulti-resolution representation