生成式視覺:GAN 與 VAE

pix2pix(配對影像轉換)

pix2pix(Isola 等人,2017)是 CycleGAN 的配對對應版本:當你確實擁有匹配的「前/後」配對時,它學習影像對影像的轉換——邊緣到照片、地圖到空照圖、同一場景的白天到夜晚、素描到算繪物件。由於每個輸入都附帶其正確輸出,便能明確告訴模型「對」是什麼樣子。其洞見在於結合兩種壓力:一個重建損失說「要吻合已知的目標」,一個對抗損失說「同時也要看起來像真實影像」,兩者合力避免了單用重建損失會造成的模糊。

pix2pix 是一個以輸入影像為條件的條件式 GAN。生成器 G(x) 把輸入影像 x 映成輸出,以兩項訓練:條件對抗損失(判別器 D(x, y) 判斷配對(輸入、輸出)是否為真實匹配的配對)加上一個 L1 重建損失,即 λ 乘以 y − G(x) 的 L1 範數,朝向真實標準答案。之所以用 L1(而非 L2),是因為它較不模糊;對抗項則補上 L1 單獨會漏掉的高頻真實感。生成器是一個 U-Net(帶跳接的編碼器—解碼器,讓低層細節與結構繞過瓶頸),判別器則是一個 PatchGAN,把每個 N×N 影像區塊分類為真或假再取平均——把對抗訊號聚焦於局部紋理,而由 L1 處理全域的低頻正確性。

這個乾淨的想法是一種分工:L1 把整體結構與色彩大致弄對(低頻),而 PatchGAN 的對抗損失讓紋理銳利且合理(高頻)。pix2pix 是一個通用框架——同一架構只需更換訓練配對即可處理眾多任務——並奠定了日後被 pix2pixHD(高解析度、多尺度)與 SPADE/GauGAN(語意圖到照片)擴展的範本。它的硬性要求是對齊的配對資料;當配對不可得時,便退而使用 CycleGAN 這類未配對方法,以可靠性換取「不需配對」。

pix2pix 需要像素對齊的配對——輸入與目標必須配準到相同的幾何,否則 L1 項會與資料相牴觸。PatchGAN 的區塊大小是個實實在在的旋鈕:太小會產生鋪磚/紋理假影,太大則趨近於整張影像的判別器,較難訓練且過度懲罰;論文發現中等的感受野(約 70×70)最能在銳利度與無假影之間取得平衡。

又稱
pix2pixpaired image-to-image translation