物件偵測

區域提議

區域提議是一個候選框,它說「這裡也許有個物件,值得進一步細看」——但還不說那物件是什麼。其構想是把偵測拆成兩個比較便宜的問題。與其在每一個可能的位置、尺度與長寬比上跑一次完整分類器(數以百萬計的視窗),不如先產生幾百或幾千個有希望的區域,再只對這些區域花費昂貴的分類運算。提議大幅縮小了搜尋空間。

早期的提議方法是在任何深度網路之前執行的、基於影像的古典演算法。Selective Search(R-CNN 與 Fast R-CNN 採用)依顏色與紋理把影像過度分割成超像素,再貪婪地把相似的鄰居合併成一個區域階層,並把合併後的框作為提議輸出——每張影像約 2,000 個。EdgeBoxes 則依一個框完整包住多少輪廓來評分。這些方法都是類別無關的:它們追求對「物件性」的高召回,把標註與過濾交給後面的分類器。

評估一組提議的關鍵指標,是在給定提議數量下的召回率:只用 N 個提議時,有多少比例的真實物件至少被一個提議重疊到(IoU 超過門檻)。好的生成器能以很少的提議達到高召回,因為每多一個提議都會耗費下游運算。這裡有一個直接的速度/準確度權衡:提議愈多抓到的物件愈多,但偵測器也愈慢。

分水嶺式的改變,是讓提議這一步變得可學習、並與偵測骨幹共享。Faster R-CNN 以區域提議網路(RPN)取代 Selective Search——那是在共享特徵圖上的一個小型卷積頭——把提議從一個固定的外部前處理步驟,變成模型中一個受訓練、對 GPU 友善的部分。這是第一代偵測器與現代兩階段偵測器之間的概念樞紐。

提議把召回與精確度解耦:提議階段為召回而調(別漏掉物件,容忍雜訊),分類階段為精確度而調(剔除雜訊)。一組高召回的提議是前提——第二階段永遠無法救回任何沒有任何提議涵蓋過的物件。

又稱
object proposalcandidate regionRoI