影像分割
條件隨機場精修
條件隨機場(conditional random field,CRF)精修是一個古典的後處理步驟,它接過神經網路那張柔和、略顯模糊的標籤圖,加以銳化,使邊界貼合影像中真實的邊緣。其直覺是一個關於世界樣貌的內建先驗:顏色相近且位置相鄰的像素幾乎總屬於同一物體,因此它們的標籤應該一致。原始的 CNN(尤其早期那些大量下採樣的)忽略這點,產生模糊、外溢的邊界;CRF 把它們拉回正軌。
形式上,CRF 在整個標籤指派上定義一個能量,含兩種項。一元項(unary term)是給某像素某特定標籤的成本,直接取自網路逐像素的類別分數(它說「網路認為這裡大概是道路」)。成對項(pairwise term)是兩個像素標籤不一致的成本,當兩像素在位置與顏色上相近時它會很大(它說「這兩個看起來相像又相鄰,所以對把它們標成不同類別加以懲罰」)。最小化總能量,就是在網路的信賴度與「空間-顏色平滑性」之間做權衡。
對深度學習真正關鍵的版本是 Krähenbühl 與 Koltun(2011)的全連接 DenseCRF,其中每個像素都透過位置與顏色上的高斯核與其他每個像素相連。天真地求解會難以負荷,但一個高效的平均場(mean-field)近似使它變快,整件事甚至能展開成循環網路層(CRF-as-RNN)並端對端訓練。DeepLabv1 與 v2 用 DenseCRF 多賺了好幾個 mIoU 分數。從 DeepLabv3 起它被捨棄,因為更強的骨幹、空洞卷積與 ASPP 所產生的邊界已夠俐落,這個額外步驟不再划算。
CRF 精修能改善邊界,卻無法修正錯誤的類別——若網路自信地把一整塊區域標錯,平滑性先驗只會樂於維持那個錯誤、僅僅把邊緣修整乾淨。
又称