物件偵測

無錨框偵測

無錨框偵測直接從影像位置——點、中心或角點——預測物件,而不先鋪設一格預先定義的錨框。其動機是刪掉錨框帶來的整套麻煩:它們的尺度與長寬比是你必須針對資料調整的超參數,它們製造出大多為背景的框、造成嚴重失衡,而以 IoU 把錨框匹配到物件又是一套繁瑣、依資料集而異的配方。若你能在從不定義任何錨框的情況下偵測物件,這一切都會消失。

主要有兩種風味。基於關鍵點的方法以特殊的點代表物件並把它們分組:CornerNet 預測左上與右下角點的熱圖,並透過學習得來的嵌入把屬於同一物件的角點配對;CenterNet(「Objects as Points」變體)更簡單,每類別預測單一個中心點熱圖,外加在每個峰值處回歸寬/高與一個小偏移——偵測變成關鍵點估計,在框的意義上沒有 NMS。ExtremeNet 則使用極點(最上、最左等)。

中心/密集方法保留 RetinaNet 那種逐像素的密集預測風格,但拋棄錨框。FCOS(Fully Convolutional One-Stage)把每一個落在真實框內部的特徵圖位置視為正樣本,並在該位置直接回歸到框的左/右/上/下四條邊的距離,外加一個類別分數與一個「中心度」(center-ness)分數,後者降低離物件中心較遠之預測的權重(一個對 NMS 友善之信心值的學習版替代品)。多個 FPN 層級則解決每個位置該負責哪個尺度的物件。

無錨框偵測器在準確度上匹敵或勝過基於錨框者,同時超參數更少、程式碼往往更簡單,這正是現代 YOLO 系列(v8 起)與許多生產用偵測器轉向無錨框的原因。注意多數仍依賴 NMS 去除重複偵測——「無錨框」移除的是錨框先驗,未必移除後處理;連 NMS 也完全移除,是 DETR 這類集合預測 transformer 另外的貢獻。

令人混淆的是,「CenterNet」指的是 2019 年兩篇不同的論文:「Objects as Points」(中心點熱圖回歸)與「CenterNet: Keypoint Triplets」(中心 + 兩角點,建於 CornerNet 之上)。當有人說 CenterNet 時,要問清楚是哪一個。

又称
keypoint-based detectioncenter-based detection