[论文解读] UVCGAN v2: An Improved Cycle-Consistent GAN for Unpaired Image-to-Image Translation
UVCGAN v2 通过整合视觉变换器(ViT)和风格调制卷积块,改进了循环一致性 GAN,在判别器设计上防止模式崩溃,并应用现代 GAN 训练技术,显著提升了无配对图像到图像翻译的性能。在 CelebA-HQ 男性到女性图像翻译任务中,其 FID 分数相比最先进扩散模型提升了 40%,优于基于 GAN 和扩散模型的方法,同时对标准像素级忠实度度量的有效性提出了质疑。
An unpaired image-to-image (I2I) translation technique seeks to find a mapping between two domains of data in a fully unsupervised manner. While initial solutions to the I2I problem were provided by generative adversarial neural networks (GANs), diffusion models (DMs) currently hold the state-of-the-art status on the I2I translation benchmarks in terms of Frechet inception distance (FID). Yet, DMs suffer from limitations, such as not using data from the source domain during the training or maintaining consistency of the source and translated images only via simple pixel-wise errors. This work improves a recent UVCGAN model and equips it with modern advancements in model architectures and training procedures. The resulting revised model significantly outperforms other advanced GAN- and DM-based competitors on a variety of benchmarks. In the case of Male-to-Female translation of CelebA, the model achieves more than 40% improvement in FID score compared to the state-of-the-art results. This work also demonstrates the ineffectiveness of the pixel-wise I2I translation faithfulness metrics and suggests their revision. The code and trained models are available at https://github.com/LS4GAN/uvcgan2
研究动机与目标
- 为解决当前无配对图像到图像翻译模型的局限性,特别是源数据利用不足以及扩散模型中对简单像素级一致性的依赖。
- 通过整合未在无配对 I2I 任务中普遍应用的现代架构与训练进步,提升循环一致性 GAN 的性能。
- 挑战现有像素级忠实度度量的有效性,并提出与感知对齐的替代方案。
- 在多样化的翻译基准(包括 CelebA、CelebA-HQ 和 AFHQ)上实现最先进性能。
提出的方法
- 提出一种混合神经架构,结合视觉变换器(ViT)与风格调制卷积块,以提升特征表示与风格迁移能力。
- 通过专用头增强判别器,缓解模式崩溃,提升训练稳定性和多样性。
- 将现代 GAN 训练技术(如渐进式生长、谱归一化及改进的梯度惩罚)适配至无配对 I2I 设置。
- 采用优化超参数(λ_cyc=5, λ_GP=0.1, γ=100)的循环一致性损失,以保持结构保真度。
- 在对抗训练前引入自监督预训练阶段,以提升收敛速度与生成质量。
- 通过提出与感知对齐的替代度量,重新评估并修订忠实度度量,超越简单的 L2 像素级距离。

实验结果
研究问题
- RQ1现代化的循环一致性 GAN 架构是否能在无配对图像到图像翻译任务中超越最先进扩散模型?
- RQ2现代 GAN 训练技术如何影响循环一致性 I2I 模型的性能与稳定性?
- RQ3标准像素级一致性度量在多大程度上准确反映人类对翻译忠实度的感知?
- RQ4结合 ViT 与风格调制卷积是否能提升翻译任务中的图像真实感与语义一致性?
- RQ5修订后的忠实度度量是否能更好地与人类对翻译质量的评估对齐?
主要发现
- UVCGAN v2 在 CelebA-HQ 男性到女性图像翻译任务中,相比最先进扩散模型 EGSDE,FID 分数提升了 40%。
- 在相同 CelebA 男性到女性基准上,与原始 UVCGAN 相比,其图像真实感提升超过 50%。
- 像素级一致性损失(L2)存在权衡:λ_consist 越高,像素级忠实度越好,但图像真实感显著下降,尤其在猫到狗等复杂任务中。
- 当 λ_consist 超过 0.2 时,猫到狗翻译任务中真实感出现灾难性下降,凸显数据集依赖的敏感性。
- 研究发现,当前像素级忠实度度量与人类感知不一致,并提出改进的、与感知对齐的替代度量。
- 消融实验证实,最优超参数(λ_cyc=5, λ_GP=0.1, γ=100)在高质量数据集(如 CelebA-HQ 和 AFHQ)上具有一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。