影像分割
U-Net
U-Net 是一個極為俐落且有效的編碼器-解碼器設計,因而成為生醫影像分割(以及遠超出此範圍)的預設選擇。畫出來,它的形狀就是字母 U:收縮(下採樣)的編碼器走在左臂,擴張(上採樣)的解碼器走在右臂,而水平的跳接在每一層橫向相連。由 Ronneberger、Fischer 與 Brox 於 2015 年為細胞與組織影像提出,十年後仍是首選基準,甚至作為許多影像擴散模型(diffusion model)內部的去雜訊骨幹。
它的標誌特徵是以串接(concatenation)實作的跳接。在每個解析度層級,來自編碼器、富含細節的特徵圖會在進一步處理前,串接到解碼器中已上採樣的特徵圖上。這讓解碼器同時握有來自網路深處的抽象「是什麼」與來自對應淺層的精確「在哪裡」,正是這點造就了 U-Net 著名的俐落邊界,連細胞膜、血管這類纖細結構也分得清楚。
若干設計選擇反映出它源於醫學、標註資料稀缺的背景。原始版本使用不補零的(valid)卷積,故輸出小於輸入,並以重疊鋪磚策略(overlap-tile)在邊界處鏡像影像,以無縫分割大型切片。它大量倚賴激進的資料增強(data augmentation),尤其是彈性形變(elastic deformation),以便僅憑少量標註影像學習。它還使用逐像素加權的損失,對相鄰細胞之間的細小縫隙加重懲罰,迫使網路學會分隔邊界。後來的 nnU-Net 框架更證明:一個配置得當、附帶自動化前處理與訓練配方的樸素 U-Net,在醫學基準上仍勝過大多數更花俏的架構。
U-Net 在小資料集上的強項也是一個警訊:它的跳接讓它能很快擬合資料,因此若缺乏強力的增強與正則化,它在極小的醫學資料集上會很快過擬合(overfit)。