生成式視覺:GAN 與 VAE

深度卷積生成對抗網路

DCGAN 是讓 GAN 真正能在影像上訓練起來的那個模型,靠的是寫下一套架構準則的「食譜」。在它之前,影像上的 GAN 出了名地不穩定;DCGAN(Radford、Metz 與 Chintala,2015)找出一組卷積網路的設計選擇,能可靠地產生銳利的 64×64 影像並穩定訓練,這些選擇也成了此後多年眾多 GAN 的預設骨幹。

核心準則如下:用步幅卷積(判別器中)與分數步幅/轉置卷積(生成器中)取代所有池化,讓網路自行學習上採樣與下採樣;在兩個網路中都使用批次正規化,但不用在生成器的輸出層與判別器的輸入層(會造成不穩);為更深的架構移除全連接隱藏層(採全卷積設計);生成器除輸出為 tanh 外,所有層用 ReLU;判別器所有層用 LeakyReLU。生成器接受一個 100 維的高斯 z,將它投影並重塑成一個小的空間張量,再透過轉置卷積上採樣成最終影像。

除了穩定訓練外,DCGAN 還證明所學到的潛在空間是有結構、語意上有意義的:在兩個 z 向量之間內插會讓生成影像平滑漸變,而 z 中的向量算術也成立(人臉上著名的「微笑女子 − 無表情女子 + 無表情男子 ≈ 微笑男子」)。它也顯示判別器所學的特徵很適合下游分類,佐證了有用的表示學習。如今 DCGAN 是基準與教學模型、而非最先進技術,但它的慣例迴盪在此後幾乎每一個影像 GAN 之中。

DCGAN 的批次正規化會把批次內的樣本耦合在一起,可能引入批次內相關性,且與極小批次、或與後來 GAN 所用的梯度懲罰相處不佳(在那些情況下更偏好層/實例正規化或頻譜正規化)。請把 DCGAN 的準則當作一個強而有力的起點,而非金科玉律——WGAN-GP、頻譜正規化與 StyleGAN 各自都修訂過它們。

又稱
DCGANdeep convolutional GAN