傳統辨識方法

支援向量機影像分類器

支援向量機(support vector machine, SVM)影像分類器會先把每張影像轉成固定長度的人工設計特徵向量——例如 HOG 描述子、視覺詞袋直方圖、GIST 或色彩直方圖——然後學一條把某一類向量與另一類分開的邊界。SVM 的核心想法是最大間隔邊界(maximum-margin boundary):在所有能把正例與負例分開的超平面中,它挑出能在兩類之間留下最寬空街道的那一個。正好坐在這條街道邊緣上的訓練樣本就是支援向量(support vectors);唯有它們決定了邊界,其餘資料即使移除也不會改變邊界。

精確地說,線性 SVM 會找出一個權重向量 w 與偏移量 b,使每個訓練點到平面 w·x + b = 0 的帶號距離盡可能大,並要求各點落在正確的一側。真實資料很少能完美分開,因此軟間隔(soft-margin)形式加入鬆弛變數與懲罰參數 C,用以在更寬的間隔與少數錯分之間取捨;C 大則重罰錯誤(有過度擬合風險),C 小則容忍較多錯誤以換取較平滑的邊界。核技巧(kernel trick)接著讓同一套機制能畫出彎曲的邊界:把每個內積 x·x′ 換成核函數 k(x, x′)——例如 RBF(高斯)核,或視覺領域偏好的直方圖交集核與卡方核——SVM 就彷彿把特徵映射到維度高得多的空間並在那裡找到一個平的邊界,而完全不必明確算出這個映射。

在整個 2000 年代的大部分時間,HOG 特徵加線性 SVM 是物件辨識與偵測的主力(它是 Dalal–Triggs 行人偵測器與可變形部件模型的核心),因為它在測試時很快(每個視窗只需一次內積)、需要的訓練資料相對少,且泛化良好。SVM 本質上是二元的,因此多類別辨識是靠訓練多個「一對其餘」或「一對一」的分類器拼成。其硬性限制在於 SVM 只看得到你交給它的特徵:若你的 HOG 或詞袋表示丟掉了你所需的區別,任何核都救不回來。正是這種對人工特徵的依賴,被卷積網路藉由「同時學習特徵與分類器」所消除——不過在凍結的 CNN 或 CLIP 嵌入之上接一個線性 SVM 或 softmax 層,至今仍是強而常見的基準。

為何對視覺特別重要:視覺核很關鍵。把通用的 RBF 核換成直方圖交集核或卡方核——它們以分布應有的方式逐格比較兩個直方圖——在詞袋特徵上往往能提升好幾個百分點的準確度,提醒我們:選對相似度量測和選對分類器一樣重要。

又稱
SVM classifiersupport vector machine classifier