邊界框(bounding box)
/ BOWND-ing boks /
邊界框是說明「物體在圖像裡何處」的最簡單方式:一個正立的矩形,畫得剛好大到能把它裝進去。它由四個數字來描述——通常是一個角的位置外加寬和高,或者一對對角的座標。當一個目標偵測器宣布「這裡有一輛車」時,那個「這裡」就是一個邊界框。它是電腦視覺裡定位的基本單元,故意做得粗糙,以便預測、儲存和推理起來都很廉價。
正因為框如此簡單,它有一種乾淨俐落的打分方式。要檢查一個預測出的框好不好,我們用「交並比」(Intersection over Union,IoU)把它和人工畫出的正確框相比:兩個框重疊的面積,除以它們共同覆蓋的總面積。完美匹配時IoU為1,毫無重疊時為0;一次偵測通常要超過某個閾值(比如0.5)才算正確。整個領域,就是用這一個數字來衡量偵測的準確率。
需要內化的,是「框」捨棄了什麼。一個正立的矩形無法貼合傾斜的、圓的或鋪展開的形狀,所以它總會吞進一些背景——圍住一輛腳踏車的框,大半是車架與車輪之間的空氣。它無法表示精確的輪廓,無法分開同一個矩形內相互重疊的兩個物體,也無法捕捉朝向。當這些事情要緊時,你就得去取更豐富的輸出:旋轉框、關鍵點,或來自分割的像素遮罩。邊界框之所以長存,不是因為它準確,而是因為它是對「哪裡」的一個快速、夠用的把手。
一個偵測器為一隻狗預測出一個框,角點在(100, 60),寬80、高50。人工標註的正確框在(105, 65),寬75、高48。兩者重疊得很厲害,IoU大約為0.82——遠高於通常的0.5閾值,所以這算作一次正確的偵測。
四個數字定位物體;與正確框比較的IoU,把「足夠接近」變成一個精確的分數。
邊界框永遠是一個與座標軸對齊的矩形,所以在非矩形物體周圍它必然框進背景,也無法分開相互重疊的東西、或表示朝向。它是對位置的一個有意做得粗糙的把手——要精確的形狀,你需要的是分割遮罩,而不是框。