評估、穩健性與倫理

平均精確率均值

平均精確率均值(mAP)是物件偵測的招牌分數——決定哪個偵測器在 COCO 或 PASCAL VOC 上「勝出」的那個數字。偵測比分類更難評斷,因為模型會輸出許多框,每個框都帶有類別標籤、信心分數與位置,而這三者都必須答對。mAP 把「定位準確度、分類準確度、依信心排序」三者揉成一個介於 0 到 1 的單一數字,其計算方式既獎勵「找到每一個物件」(召回率),又不讓答案淹沒在假框裡(精確率)。

逐步建構:首先你要用交集比聯集(IoU,重疊面積除以聯集面積)與一個閾值(例如 IoU ≥ 0.5)來判定一個預測框何時「算」匹配某個真實框。接著,針對某一類別,你把所有預測框依信心排序並由上往下掃描,在每一步計算精確率與召回率;這描繪出一條精確率–召回率曲線。平均精確率(AP)就是該曲線下的面積——單一類別在所有信心閾值上的品質。mAP 則是 AP 在所有類別上的平均,因此無論某類別有多常見,每個類別的權重都相等。

IoU 閾值是一個旋鈕,用來設定「正確位置」必須有多嚴格。較舊的 PASCAL VOC 指標使用單一寬鬆閾值([email protected])。現代 COCO 回報 mAP@[.5:.95]:它在 0.50 到 0.95、步長 0.05 的十個 IoU 閾值上計算 AP 再取平均,要求框越來越貼合。這就是為什麼一個模型可能拿到 55 [email protected]、卻只有 37 mAP@[.5:.95]——更嚴格的平均會懲罰草率的定位。COCO 也依物件大小(小/中/大)拆分結果,揭露小物件通常最難。

幾個細節會成就或毀掉這個數字。每個真實框只能被一個預測(信心最高的那個)匹配;其餘重疊的預測都成為假正例,這正是非極大值抑制(NMS)重要的原因。重複或低品質的框會在高召回率端把精確率往下拉,因此 AP 這個積分真正衡量的是完整的精確率–召回率行為,而非單一操作點。由於 mAP 是對各類別平均,把稀有類別做好與把常見類別做好同樣有價值——這個性質讓它成為一個公平卻嚴苛的基準,從 Faster R-CNN 到 DETR 與現代 Transformer 偵測器都在用它。

務必註明所用協定:單講「mAP」是含糊的。[email protected](VOC 式)與 mAP@[.5:.95](COCO 式)在同一模型上可能相差 15–20 分,而實例分割的 mAP 用的是遮罩 IoU 而非框 IoU。跨協定比較數字毫無意義。

又称
mAPAPCOCO mAP[email protected]mAP@[.5:.95]