[论文解读] Dual Contrastive Loss and Attention for GANs
本文提出一种双重对比损失与注意力机制,以提升基于GAN的图像生成效果,显著增强特征表示能力与长程建模性能。通过在生成器中结合新型对比损失与自注意力机制,在判别器中引入参考注意力机制,该方法在基准数据集上FID指标至少提升17.5%,在CLEVR等组合性场景上最高提升47.5%,在图像质量和真实感方面创下新的SOTA水平。
Generative Adversarial Networks (GANs) produce impressive results on unconditional image generation when powered with large-scale image datasets. Yet generated images are still easy to spot especially on datasets with high variance (e.g. bedroom, church). In this paper, we propose various improvements to further push the boundaries in image generation. Specifically, we propose a novel dual contrastive loss and show that, with this loss, discriminator learns more generalized and distinguishable representations to incentivize generation. In addition, we revisit attention and extensively experiment with different attention blocks in the generator. We find attention to be still an important module for successful image generation even though it was not used in the recent state-of-the-art models. Lastly, we study different attention architectures in the discriminator, and propose a reference attention mechanism. By combining the strengths of these remedies, we improve the compelling state-of-the-art Fréchet Inception Distance (FID) by at least 17.5% on several benchmark datasets. We obtain even more significant improvements on compositional synthetic scenes (up to 47.5% in FID). Code and models are available at https://github.com/ningyu1991/AttentionDualContrastGAN .
研究动机与目标
- 为解决尽管生成模型性能已达SOTA水平,但生成图像仍易被检测到的问题。
- 提升判别器的泛化能力与表征学习能力,以减少模式崩溃并提升生成质量。
- 重新评估注意力机制在现代GAN中的作用,尤其是在近期SOTA模型(如StyleGAN2)中忽略注意力机制的背景下。
- 在判别器中设计一种新型参考注意力机制,利用真实图像作为参考,以在小样本数据集上稳定训练。
- 证明对比学习可与注意力机制协同作用,生成更优、更具鲁棒性的生成模型。
提出的方法
- 引入双重对比损失以替代标准对抗损失,促使判别器学习更具泛化性与可区分性的真实与虚假样本表征。
- 在生成器中集成自注意力模块,以建模图像区域间的长程依赖关系,提升结构一致性与细节生成能力。
- 在判别器中提出一种参考注意力机制,其中两个孪生分支分别处理真实参考图像与主图像(真实或生成),并以真实图像引导注意力,从而减少过拟合。
- 采用对比学习框架,通过比较真实与虚假特征的正样本对与负样本对,增强判别能力与特征多样性。
- 使用带有双重对比损失的最小最大目标训练GAN,为生成器提供更优的梯度信号。
- 将双重对比损失与生成器中的自注意力机制、判别器中的参考注意力机制相结合,实现图像质量的协同提升。
实验结果
研究问题
- RQ1与标准GAN损失相比,双重对比损失是否能提升判别器的泛化能力并带来更优的图像生成质量?
- RQ2在近期SOTA模型(如StyleGAN2)中已不再使用注意力机制的背景下,注意力机制是否仍能提升GAN性能?
- RQ3注意力机制的选择如何影响不同数据集与不同数据规模下生成器与判别器的性能表现?
- RQ4所提出的判别器中的参考注意力机制是否能提升泛化能力,特别是在小规模数据集上?
- RQ5对比学习与注意力机制的联合效应如何影响图像生成质量,特别是在CLEVR等复杂组合性场景中?
主要发现
- 在CLEVR数据集上,双重对比损失使FID降低高达37%,显著证明其在泛化能力与表征学习方面的优势。
- 生成器中自注意力机制与双重对比损失的结合,在多个大规模数据集上实现了至少17.5%的FID相对降低。
- 在CLEVR数据集上,该方法显著减少了颜色泄漏、不连续性与结构错误等伪影,尤其在存在遮挡、阴影与反光的场景中表现更优。
- 参考注意力判别器通过利用真实参考图像引导注意力,有效减少过拟合,显著提升小规模数据集上的性能。
- 在Bedroom数据集上,自注意力生成器使FID降低高达13.3%,凸显其在复杂、高方差场景中的优势。
- 在FFHQ数据集上,自注意力未带来性能提升,可能由于面部关键点对齐已补偿局部归纳偏置,表明注意力机制的收益具有上下文依赖性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。