[论文解读] Improving GANs with A Dynamic Discriminator
本文提出 DynamicD,一种在 GAN 训练过程中动态调整判别器容量的方法,以匹配生成样本与真实样本之间区分难度的时变特性。通过在数据充足时增加容量、在数据稀缺时减少容量,DynamicD 在不增加额外计算成本或损失函数的情况下提升了图像生成质量,在多种数据集和任务(包括 3D 感知生成)上实现了最先进(SOTA)的 FID 分数。
Discriminator plays a vital role in training generative adversarial networks (GANs) via distinguishing real and synthesized samples. While the real data distribution remains the same, the synthesis distribution keeps varying because of the evolving generator, and thus effects a corresponding change to the bi-classification task for the discriminator. We argue that a discriminator with an on-the-fly adjustment on its capacity can better accommodate such a time-varying task. A comprehensive empirical study confirms that the proposed training strategy, termed as DynamicD, improves the synthesis performance without incurring any additional computation cost or training objectives. Two capacity adjusting schemes are developed for training GANs under different data regimes: i) given a sufficient amount of training data, the discriminator benefits from a progressively increased learning capacity, and ii) when the training data is limited, gradually decreasing the layer width mitigates the over-fitting issue of the discriminator. Experiments on both 2D and 3D-aware image synthesis tasks conducted on a range of datasets substantiate the generalizability of our DynamicD as well as its substantial improvement over the baselines. Furthermore, DynamicD is synergistic to other discriminator-improving approaches (including data augmentation, regularizers, and pre-training), and brings continuous performance gain when combined for learning GANs.
研究动机与目标
- 为解决 GAN 训练中时间变化的二分类任务挑战,其中生成器输出分布随时间演变,而真实数据分布保持不变。
- 探究固定容量的判别器是否足以应对这种动态任务,尤其是在不同数据配置下。
- 开发一种简单、高效的训练策略,实现实时调整判别器容量以提升 GAN 性能。
- 评估所提方法在多种数据集和架构(包括 2D 和 3D 感知图像生成)中的泛化能力与兼容性。
- 展示与现有判别器改进技术(如数据增强、正则化和预训练)的协同效应。
提出的方法
- DynamicD 根据数据配置在训练过程中动态调整判别器的层宽度:在数据充足时增加容量,在数据稀缺时减少容量。
- 该方法使用线性调度调整判别器全连接或卷积层的宽度,实现运行时的容量自适应。
- 在大数据配置下,判别器从较窄开始,随训练时间逐步增宽,以匹配生成分布复杂度的提升。
- 在小数据配置下,判别器从较宽开始,随训练进程逐步变窄,以防止过拟合。
- 该方法无需额外的训练目标或计算开销,仅依赖训练过程中的架构自适应。
- 该方法与现有 GAN 训练技术兼容,包括数据增强(ADA)、正则化(zCR)和预训练(FreezeD),可与之结合以获得进一步性能提升。
实验结果
研究问题
- RQ1固定容量的判别器是否无法适应 GAN 训练中时间变化的二分类任务难度,其中生成器输出分布随时间演变?
- RQ2能否通过动态调整判别器容量在不增加计算成本或引入新损失函数的前提下提升 GAN 生成性能?
- RQ3是否存在与数据配置相关的最优容量调整策略——例如,在大数据下增加容量,在小数据下减少容量?
- RQ4DynamicD 是否能与现有判别器改进技术(如数据增强、正则化和预训练)有效结合?
- RQ5DynamicD 是否在多种任务中具有泛化能力,包括 2D 图像生成和 3D 感知图像生成?
主要发现
- 在 FFHQ 2K 图像数据集上,DynamicD 将 FID 从 82.17(ADA)降低至 62.30,表明在低数据配置下具有持续改进效果。
- 在 FFHQ 140K 图像数据集上,DynamicD 将 FID 从 15.62(ADA)降低至 14.56,证明即使在数据充足时也具有显著有效性。
- 在 FFHQ 和 Carla 数据集的 3D 感知图像生成任务中,DynamicD 将 FID 从 73.50 降至 23.29(FFHQ-2K)和从 53.87 降至 47.42(Carla-10K),显著提升了多视角一致性。
- 在 MetFaces 上进行预训练后,DynamicD 将 FID 从 22.93(微调基线)降低至 20.52,表明其兼容性与附加优势。
- 当与 ADA 结合时,DynamicD 在 FFHQ-2K 上将 FID 改进 53.8%,在 FFHQ-140K 上改进 8.5%,证实其与现有方法的协同效应。
- 该方法在多个数据集和任务中均实现了最先进性能,包括 2D 和 3D 感知图像生成,且无需额外训练成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。