物件偵測

Faster R-CNN

Faster R-CNN(Ren 等人,2015)完成了從 R-CNN 到一個完全端對端可訓練、純 GPU 的兩階段偵測器的旅程,方法是移除最後一個緩慢、手工打造的元件:外部提議生成器。其洞見是:為偵測而已經算好的卷積特徵圖,也已包含提議區域所需的一切——於是它加裝一個小型區域提議網路(RPN),直接從那些共享特徵中生成提議,幾乎不花成本。

其架構是兩個共享一個骨幹的頭。第一階段,即 RPN,在特徵圖上滑動,並在每個位置、每個錨框上預測一個物件性分數與四個框微調偏移量,輸出幾百到幾千個提議。第二階段本質上就是 Fast R-CNN:對每個提議內的特徵做 RoI 池化(後來改為 RoIAlign),再跑分類 + 框回歸的頭。由於兩階段讀的是同一張特徵圖,提議生成只多花幾毫秒——提議時間從約 2 秒(Selective Search)降到約 10 毫秒。

訓練會共同最佳化四個損失:RPN 物件性(二元交叉熵)與 RPN 框回歸,外加第二階段的分類(對 K+1 類別的 softmax)與框回歸。原始論文用一種交替的 4 步訓練流程,讓兩階段共享特徵;後來證明它們可在一次傳遞中一起訓練(近似聯合訓練)。其成果是當時最先進的準確度,並依骨幹不同達到約每秒 5–17 幀。

Faster R-CNN 成為兩階段偵測器的典範,也是一整條研究血脈的基幹:Mask R-CNN 在其上加了實例分割遮罩頭與 RoIAlign;特徵金字塔網路(FPN)則接入以跨尺度偵測物件。它「先提議、再驗證」的兩階段設計通常能給出頂尖準確度——尤其在小物件上——代價是比 YOLO 或 RetinaNet 這類單階段偵測器更慢、更複雜。

兩階段對單階段是這個領域的核心權衡。Faster R-CNN 的 RPN 在昂貴的第二階段之前就已濾掉大多數背景,使分類器看到的是一組較平衡的候選——這正是兩階段偵測器在歷史上準確度領先的原因。單階段偵測器則必須發明 focal loss,以應付那個原本被 RPN 隱藏起來的前景/背景失衡。

又称
Faster R-CNN