特徵與描述子

方向梯度直方圖

方向梯度直方圖(Histogram of Oriented Gradients, HOG),由 Navneet Dalal 與 Bill Triggs 於 2005 年為行人偵測提出,透過總結邊緣方向的局部分布來捕捉物件的形狀,同時刻意丟棄每條邊緣究竟落在哪裡的精確資訊。其直覺是:站立的人、車或臉都有一個特徵性的梯度輪廓:軀幹兩側強烈的垂直邊緣、頭部圓弧狀的梯度樣式,諸如此類。若你逐區域記錄出現了哪些梯度方向、各有多強,就得到一個能容忍小位移與變形的形狀描述,因為一條腿移動幾個像素後,仍會把相同的方向貢獻給同一個大致區域。

與描述稀疏關鍵點的 SIFT 不同,HOG 是在覆蓋整個偵測視窗的規則網格上計算的密集描述子。影像視窗被切成稱為細胞(cell)的小型相連區域(例如 8×8 像素)。在每個細胞中,每個像素的梯度方向被歸入數個方向分格之一(常用 9 個分格,跨越 0 到 180 度,把相反方向視為等價),且每個像素以其梯度大小加權投票到它所屬的分格。每個細胞的結果是一個描述當地主導邊緣方向的小直方圖。

賦予 HOG 穩健性的步驟是區塊正規化(block normalization)。原始直方圖對光照與對比敏感:把影像調亮,所有梯度大小都會等比放大。HOG 把細胞分組成較大的、重疊的區塊(block,例如 2×2 個細胞),並在每個區塊內把串接的直方圖正規化為單位長度,從而把局部對比除掉。由於區塊重疊,每個細胞會參與好幾次正規化,這增添了冗餘與穩定性。把整個視窗的正規化區塊描述子串接起來,產生一個長特徵向量,通常是數千個數字,描述該視窗的形狀。

HOG 結合線性支援向量機(SVM)在 2000 年代末是行人與物件偵測的最先進技術,而 HOG 特徵也驅動了極具影響力的可變形部件模型(Deformable Parts Model)。把 HOG 加 SVM 的分類器在各位置與尺度上滑動即可偵測物件;這既密集又略慢,可用積分直方圖技巧來緩解。此後 HOG 被卷積網路(它們學習更豐富的多層特徵)以及 DETR 等 transformer 偵測器取代。然而 HOG 在教學上仍居核心地位,在訓練資料稀少或計算緊張時仍有用,且其核心構想——把梯度方向匯集到空間細胞並做局部正規化——在現代 CNN 的最初幾層中直接迴響。

HOG 在單一描述子內刻意不對大旋轉或尺度具不變性;它假設物件大致填滿一個已知大小與姿態的視窗,這就是為什麼它要搭配多尺度滑動視窗搜尋。這與 SIFT 把不變性烤進每個關鍵點的設計選擇正好相反。要因任務選工具:HOG 用於偵測已知的物件類別,SIFT/ORB 用於跨視角比對同一個實例。

又称
HOG