機器人視覺與感知
語意分割
語意分割是這樣一種視覺任務:給一張影像裡每一個像素都塗上一個標籤,說明它屬於哪一類東西。系統不是在汽車外面鬆鬆地畫一個框,而是針對畫面裡的每一個小點,判斷它是馬路、天空、汽車、樹木還是人——從而生成一張嚴絲合縫蓋在照片上的「按編號填色」地圖。如果說目標偵測給你的是一個粗略的矩形,那麼分割勾勒的則是萬物真正的輪廓,細到一片樹葉的鋸齒邊緣、或一道路緣的弧線。
「語意」這個詞,只是說這些標籤講的是「含義」、是東西的類別,而不是一個個具體的身份。所以在一幅街景裡,所有汽車都被塗成同一種「汽車」顏色,所有行人都被塗成同一種「人」顏色;語意分割並不費心去把第一輛車和第二輛車分開。(把一個個具體個體區分開來,是一項相關但不同的任務,叫做實例分割。)這張精確到像素的類別地圖,正是自動駕駛汽車所需要的——當它要分毫不差地知道:可行駛的馬路在哪裡到頭、人行道又從哪裡開始。
和其他現代視覺任務一樣,語意分割也是用神經網路來完成的,這些網路是在人類逐個像素辛苦手工標註好的影像上訓練出來的。網路把整張圖讀進去,一次性地為每一個像素輸出一個標籤。對機器人而言,這種稠密的理解能夠支撐導航(哪些是我可以滾過去的地面?)、操作(這個物體的表面究竟在哪裡?),以及在人和障礙物周圍安全地工作。
自動駕駛汽車的分割網路會把即時攝影機畫面塗色:馬路塗成紫色、人行道塗成粉色、行人塗成紅色——好讓規劃器只在紫色區域上行駛,並遠遠避開紅色。
每個像素都有一個類別顏色——一張關於整個場景含義的地圖。
語意分割會把同一類的所有物體合併成一個標籤;實例分割則更進一步,把每一個具體的物體都分開。
又稱
另見