電腦視覺

人臉辨識(face recognition)

/ fays rek-ug-NISH-un /

人臉辨識要判定的是「這是誰的臉」。常見的流程有三步:先偵測出有一張臉、並定位它在哪裡(人臉偵測),再把那張臉轉換成一串緊湊的數字——人臉特徵碼(即嵌入),用來刻畫它獨特的幾何形狀,最後把這串特徵碼與其他的相比較。在這個數字空間裡靠得很近的兩串特徵碼,會被判定為同一個人。它本質上是在測量兩張臉有多相似,並以「距離」來表達。

一個名字底下藏著兩件事,而它們的區別很重要。驗證問的是「這個人和那個人是同一個嗎?」——一對一的核對,就像你的手機確認那是你本人。辨識問的是「在這成千上萬人裡,這是誰?」——一對多的搜索,就像拿一份監控名單去掃描一群人。後者難得多,也危險得多:在一個龐大的資料庫裡搜索,意味著哪怕每次比對的錯誤率極小,從絕對數量上看也會產生大量的錯誤匹配。

這是本領域裡倫理負擔最重的話題,誠實要求我們把局限說白。準確率會隨圖像品質、角度、光照、年齡而大幅波動,而且關鍵地隨人群而變——由於訓練數據有偏,許多系統對女性、對膚色較深的人,錯誤率明顯更高。一次自信的匹配,是統計上的相似,而非證明。出錯的後果——一次錯誤的逮捕、一次被拒之門外——落在活生生的人身上,這正是為什麼用於監控和執法的人臉辨識飽受爭議、受到監管,並在一些地方被禁止。技術「能用」,和它「該不該部署」,並不是一回事。

手機解鎖是「驗證」:它只存了你的一串人臉特徵碼,每次解鎖都只與這一串核對——一對一、風險低,而且你還能退回去用密碼。而警方拿一份一萬人的名單去掃描一座體育場人群,則是「辨識」:哪怕只有0.1%的錯誤匹配率,一次掃描也可能誤標出幾十個無辜的人。

驗證(一對一)容易且低風險;辨識(一對多)會把罕見的錯誤放大成真實的傷害。

已被記錄在案的偏差,是頭號警示:許多人臉辨識系統對女性和膚色較深者明顯更不準,所以一次「匹配」可以既自信又錯誤,且後果嚴重。廠商公布的準確率,是在有利的測試集上測出來的,在真實監控條件下往往站不住腳。

又稱
facial recognition人脸识别人臉辨識face identificationface verification