生成式視覺:GAN 與 VAE

風格生成對抗網路

StyleGAN(Karras 等人,NVIDIA,2018)重新設計了生成器,讓你能在不同尺度上控制影像的屬性——把粗略的東西如姿態與臉型,和精細的東西如髮絲紋理與雀斑分開控制——同時讓潛在空間變得遠為解耦。它不再把雜訊向量從底部餵入、任其向上流動,而是在每一層注入一個學習而來的「風格」,獨立控制每個解析度。這正是 StyleGAN 既能產生極為逼真的人臉、又能提供直覺編輯旋鈕的原因。

關鍵有兩個概念。第一,一個映射網路(8 層的 MLP)把空間 Z 中的輸入雜訊 z 轉換成空間 W 中的中介潛在 w;W 不必遵循先驗那固定的高斯形狀,因此能「攤平」資料的變異因素,使 W 比 Z 更解耦。第二,合成網路從一個學習而來的常數張量(而非從 z)開始,在每個解析度,風格 w 經由學習的仿射變換映射成逐通道的尺度與偏置,再透過自適應實例正規化(AdaIN)來調變啟動值:AdaIN 先把每張特徵圖正規化,再用風格對它重新縮放與位移。每一層還加入逐像素的高斯雜訊,以產生隨機細節(髮絲、毛孔),而不耗用潛在容量。

由於風格作用於特定解析度,風格混合(style mixing)——把粗略層的 w 取自一張影像、精細層的 w 取自另一張——能把一張臉的高層結構與另一張臉的精細紋理結合,展現解耦。StyleGAN2 以權重去調變(weight demodulation)取代 AdaIN,消除其誘發的「斑點」假影,並加入路徑長度正則化;StyleGAN3 讓生成器對平移與旋轉等變(equivariant),修正動畫中的「紋理黏滯」。W 與 W+ 空間是 GAN 反演(GAN inversion)與語意影像編輯的主力(在 W 中找一個能添加微笑、或讓臉變老的方向)。即使在擴散模型的時代,StyleGAN 仍是高解析度、可控影像合成的標竿。

StyleGAN 的逼真度可能掩蓋糾纏——許多語意編輯仍會影響相關聯的屬性(例如加上「微笑」也可能改變外觀年齡或張開嘴巴),因為訓練資料本身就讓它們相關;解耦只是改善,而非完美。此外,要忠實編輯一張真實照片,必須先把它反演到 W+ 中,而反演的品質會限制編輯的品質。

又称
StyleGANStyleGAN2StyleGAN3