Skip to main content
QUICK REVIEW

[论文解读] MCL-GAN: Generative Adversarial Networks with Multiple Specialized Discriminators

Jin‐Young Choi, Bohyung Han|arXiv (Cornell University)|Jul 15, 2021
Generative Adversarial Networks and Image Synthesis参考文献 42被引用 8
一句话总结

MCL-GAN 提出了一种生成对抗网络,采用通过多选学习(MCL)训练的多个专业化判别器,以缓解模式崩溃问题。通过在无监督条件下将每个判别器分配给不同的数据簇,生成器通过协作反馈学习到多样化且高保真的样本,实现了极低计算开销下的最先进性能。

ABSTRACT

We propose a framework of generative adversarial networks with multiple discriminators, which collaborate to represent a real dataset more effectively. Our approach facilitates learning a generator consistent with the underlying data distribution based on real images and thus mitigates the chronic mode collapse problem. From the inspiration of multiple choice learning, we guide each discriminator to have expertise in a subset of the entire data and allow the generator to find reasonable correspondences between the latent and real data spaces automatically without extra supervision for training examples. Despite the use of multiple discriminators, the backbone networks are shared across the discriminators and the increase in training cost is marginal. We demonstrate the effectiveness of our algorithm using multiple evaluation metrics in the standard datasets for diverse tasks.

研究动机与目标

  • 为解决 GAN 中持续存在的模式崩溃问题,即生成器无法覆盖所有数据模式。
  • 实现判别器在无类别标签或额外监督的情况下自动专精于不同的数据簇。
  • 通过聚合来自多个专家判别器的反馈,提升生成器的多样性与保真度。
  • 通过判别器间共享主干网络,保持计算效率。
  • 在多种 GAN 架构与任务中展示通用性,包括无条件与条件图像生成。

提出的方法

  • 该方法采用多选学习(MCL)训练多个判别器,每个判别器专精于训练过程中识别出的实数据簇子集。
  • 每个判别器基于最接近的实样本与生成样本进行更新,形成无需真实标签的动态专家分配。
  • 生成器接收来自专精于所生成样本簇的判别器的聚合反馈,促进模式覆盖。
  • 应用稀疏性损失以鼓励模型识别出最优的活跃判别器数量,提升鲁棒性。
  • 判别器间共享主干网络,尽管存在多个判别器,但额外训练成本极低。
  • 该框架可无缝集成至标准 GAN 目标中,与多种 GAN 变体及架构兼容。

实验结果

研究问题

  • RQ1通过 MCL 训练的多个专业化判别器是否能有效减少无条件 GAN 中的模式崩溃?
  • RQ2MCL-GAN 是否在不使用类别标签的情况下,实现与基于标签的判别器专精相当的性能?
  • RQ3将 MCL 与条件 GAN(如图像到图像转换、文本到图像合成)结合,对多样性与保真度有何影响?
  • RQ4平衡判别器分配与稀疏性正则化对模型收敛性与鲁棒性有何影响?
  • RQ5与现有多种判别器 GAN 相比,MCL-GAN 在效率与可扩展性方面表现如何?

主要发现

  • 在 MNIST 和 Fashion-MNIST 上,MCL-GAN 在 m=5 时分别达到 98.3% 和 97.7% 的召回率,优于 DCGAN(分别为 89.1% 和 92.7% 的召回率)。
  • 在 CUB-200-2011 数据集上,MCL-GAN 将 FID 改善至 62.9±0.001,LPIPS 改善至 0.624±0.002,表明多样性与质量均得到提升。
  • 在 StackGAN++ 的文本到图像合成任务中,MCL-GAN 显著提升了 LPIPS(多样性),同时保持了较高的 FID 与 NDB 分数。
  • 该方法在性能上可与基于标签的判别器分配相媲美(见表 6),证明 MCL 在无监督专精中的可靠性。
  • 该模型对超参数变化具有鲁棒性,尤其在应用专家训练与平衡分配时,不同 m 和 k 值下性能稳定。
  • 共享主干网络的使用确保了在多个判别器下训练成本几乎不增加,使 MCL-GAN 具备出色的计算效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。