電腦視覺
目標偵測(object detection)
/ OB-jekt dee-TEK-shun /
目標偵測回答的問題比分類更豐富:不只是圖裡有什麼,而是有什麼、在哪裡,而且一次把所有東西都找出來。它的輸出是一組框,每個框圈住一個物體,並帶上標籤和信心度——這邊「人,0.88」,那邊「車,0.95」,角落裡「狗,0.71」。一張街景照片返回十幾個框很常見。分類對整張圖只給一個判斷,偵測則把許多東西同時定位並貼上標籤。
可以把它看成兩件事合在一起:在某個東西周圍畫出一個貼合的矩形(邊界框),再說出框裡是什麼。早期系統用滑動視窗一格格掃描,做得很慢;現代系統則學會先「提議」可能有物體的區域,再在一次快速的處理中給它們貼標籤。模型還得自己判斷到底有幾個物體——人群場景和一張空桌子需要的框數天差地別——這讓任務比挑一個標籤真的難得多。
它是自動駕駛感知、零售貨架盤點、安防攝影機,以及幫你標記人臉的相簿應用背後的主力。但誠實的提醒也實實在在:偵測器會漏掉又小又遠或彼此重疊的物體;會在陰影和反光上誤報;一旦物體、光線或拍攝角度與訓練數據不同,準確率就會陡降。一個在白天城市街道上表現出色的偵測器,到了夜裡或大雨中可能就不可靠——這正是為什麼安全攸關的系統從不單獨信任它。
在一張行人穿越道照片上跑偵測器,它返回:4個行人各一個框(人,0.9以上)、一個騎車人的框(自行車0.82,人0.79),以及兩輛車。它漏掉了半藏在一條腿後面的狗,還在櫥窗裡的一個人體模特上畫了個誤報的框,標成「人 0.55」。
一次給出許多框、許多標籤——以及典型的漏檢和誤報。
邊界框是個粗糙的形狀:它永遠是一個正立的矩形,所以在傾斜或不規則物體周圍會框進背景,也無法把同一個框裡相互重疊的兩樣東西分開。當你需要精確的輪廓時,要的是分割,而不是偵測。
又稱
另見