傳統辨識方法

傳統辨識流程

傳統辨識流程(classical recognition pipeline)是深度學習之前讓電腦辨識影像內容的主導作法:先把原始像素轉成人工設計的特徵,再把這些特徵餵給一個分開訓練的分類器。這兩半是各自獨立設計與最佳化的。由人類工程師憑直覺與領域知識決定要量測影像的什麼(邊緣、梯度、顏色、紋理、關鍵點),而只有最後的決策步驟——把特徵對應到標籤——是從資料學得的。1990 與 2000 年代的整個領域,很大程度上就是在尋找越來越好的人工特徵,以及坐在其上越來越好的分類器。

影像分類流程的經典實例有幾個固定階段。你偵測並描述局部特徵(SIFT、SURF、ORB)或計算稠密描述子(HOG);你藉由把描述子分群建立視覺詞彙,並把每張影像編碼成視覺詞袋,常以稀疏編碼或 Fisher 向量加以改進;你用空間金字塔匹配加入粗略的空間結構;再用 SVM(常用直方圖交集核或卡方核)或 kNN 對所得向量分類。偵測則把這一切包進影像金字塔上的滑動視窗,有時搭配提升式級聯(Viola–Jones)或可變形部件(DPM)。每個階段都是各有其參數的獨立研究成果,由工程師親手調校與替換。其長處是真實的:這些系統可詮釋(你能檢視哪些特徵被觸發)、資料效率高(用不大的訓練集就能運作)且執行快速。

決定性的限制在於特徵是固定且通用的,從不針對實際任務調校;SIFT 與 HOG 設計一次就到處重用,因此無法學會恰好強調區分當前類別的線索,而早期被丟棄的資訊在下游永遠無法救回。深度學習藉由把流程變成端到端而超越它:卷積網路聯合學習特徵與分類器,直接針對最終目標最佳化每一層,使表示能適應任務並隨資料規模擴展。分水嶺是 AlexNet 於 2012 年贏得 ImageNet,此後學得的特徵在各方面迅速超越人工特徵,催生了 ResNet,接著是視覺 transformer(ViT)、端到端偵測器(Faster R-CNN、DETR)、影像與文字模型(CLIP),以及生成式與 3D 模型(擴散模型、NeRF、高斯潑濺、SAM)。傳統流程如今多半已成歷史,但仍至關重要而須理解——它定義了現代系統所繼承的特徵、分類器、偵測與檢索的詞彙,而它分解為各階段的方式,至今仍是我們推理一個辨識系統在做什麼的途徑。

深度學習獲勝的一句話原因:傳統流程把特徵與分類器分開最佳化,且特徵是凍結且通用的,而 CNN 則為任務聯合、端到端地最佳化兩者——因此表示本身會隨資料與目標而改進,人工特徵則做不到。其餘一切(更多資料、GPU、更好的架構)都只是加速了這個核心優勢。

又称
hand-crafted recognition pipelinefeature-then-classifier paradigm