生成对抗网络(generative adversarial network)
/ JEN-ur-uh-tiv ad-vur-SAIR-ee-ul NET-wurk /
生成对抗网络(简称 GAN),靠让两个网络在一场较量中彼此对抗,学会制造逼真的赝品。其中一个叫「生成器」,扮演造假者:它从随机噪声出发,力图造出以假乱真的假图像(或声音、或数据)。另一个叫「判别器」,扮演侦探:它被递上真例子和造假者的赝品混在一起的一堆,必须判断孰真孰假。造假者想骗过侦探;侦探想抓住造假者。它们一同训练,各自把对方逼着往上走。
妙就妙在,两边都不需要一个人去给每一份输出打分。侦探的学习,来自每猜一次后被告知对错——这就是寻常的监督学习。造假者从不直接看真实数据;它只从侦探的裁决里学习,不断调整自己,好让赝品蒙混过关。一轮轮下来,侦探越来越善于挑出瑕疵,这逼着造假者去补这些瑕疵,又逼着侦探去找更隐蔽的。在理想的终局里,造假者的输出逼真到侦探也只能像掷硬币一样瞎猜——一个移动的靶,追着另一个移动的靶。
GAN 于 2014 年问世,造出了第一批惊人逼真的合成人脸,掀起了图像生成、风格迁移和超分辨率的一波浪潮。但老实起见,必须说出告诫。GAN 出了名地难训练:这场两人博弈可能失衡而失控,还有一种常见的失败叫「模式坍缩」——造假者干脆放弃多样性,翻来覆去只产出那么几张以假乱真的图。它们还得小心提防被滥用——「深度伪造」(deepfake)一词就源自这门技术。而要论最顶级、最可控的图像生成,近年来扩散模型已大体把 GAN 超越,尽管「对抗」这一思想依然影响深远。
拿成千上万张名人照片去训练一个 GAN。一开始,生成器造出的脸糊成一团,判别器一眼就识破。许多轮过后,生成器画出了一些从不存在之人的肖像,逼真到判别器——常常连随意一瞥的人——都再也分不出它们和真照片的区别。
造假者对侦探:唯有竭力击败对方,各自才得以变强。
GAN 的两个网络只有通过竞争才能进步,所以训练很微妙——它可能坍缩成只产出那么几张图(即「模式坍缩」)。而那项造出惊人合成人脸的技术,与深度伪造背后是同一项;能力本身是中性的,用途却未必。