[论文解读] Dual Generator Generative Adversarial Networks for Multi-Domain Image-to-Image Translation
该论文提出 G2GAN,一种用于可扩展、多领域无配对图像到图像翻译的双生成器 GAN 框架,仅使用单一模型。与以往方法需要多个模型或共享单个生成器用于翻译和重建不同,G2GAN 采用任务特定的生成器(翻译和重建)并结合灵活的参数共享,通过联合优化颜色循环一致性、SSIM 和身份损失,实现了更优的图像质量和稳定性,在包括人脸、风景和建筑在内的六个数据集上超越了最先进模型。
State-of-the-art methods for image-to-image translation with Generative Adversarial Networks (GANs) can learn a mapping from one domain to another domain using unpaired image data. However, these methods require the training of one specific model for every pair of image domains, which limits the scalability in dealing with more than two image domains. In addition, the training stage of these methods has the common problem of model collapse that degrades the quality of the generated images. To tackle these issues, we propose a Dual Generator Generative Adversarial Network (G$^2$GAN), which is a robust and scalable approach allowing to perform unpaired image-to-image translation for multiple domains using only dual generators within a single model. Moreover, we explore different optimization losses for better training of G$^2$GAN, and thus make unpaired image-to-image translation with higher consistency and better stability. Extensive experiments on six publicly available datasets with different scenarios, i.e., architectural buildings, seasons, landscape and human faces, demonstrate that the proposed G$^2$GAN achieves superior model capacity and better generation performance comparing with existing image-to-image translation GAN models.
研究动机与目标
- 解决现有无配对图像到图像翻译方法在为每对领域训练时需训练多个模型所导致的可扩展性与模型崩溃问题。
- 通过使用两个专用生成器而非共享一个生成器,将翻译和重建任务解耦,以提升训练稳定性和生成质量。
- 通过单一模型实现高效的多领域翻译,将所需模型数量从 Θ(m²) 减少至仅一个,即使在领域数量庞大时亦可实现。
- 探索并整合多种优化损失——颜色循环一致性、多尺度 SSIM 和身份损失——以增强训练稳定性和图像保真度。
提出的方法
- G2GAN 使用两个不同的生成器:一个翻译生成器 Gᵗ,将源域 X 的图像映射到目标域 Y,使用目标域标签 zᵧ;一个重建生成器 Gʳ,将生成的图像反向映射回原始域 X,使用原始标签 zₓ。
- 两个生成器与共享判别器联合训练,实现对抗性训练,同时保持任务特定的网络架构和参数共享程度。
- 引入颜色循环一致性损失,以在翻译和重建路径之间保持颜色分布一致,提升视觉保真度。
- 引入多尺度 SSIM 和身份损失,以增强结构一致性并保留身份特征,尤其在人脸翻译任务中表现显著。
- 模型支持灵活的参数共享策略——完全共享、部分共享或不共享——实现模型容量与性能之间的权衡。
- 框架通过联合优化目标端到端训练,结合对抗性损失、循环一致性损失和感知损失,稳定训练并缓解模式崩溃。
实验结果
研究问题
- RQ1是否能够通过单一模型架构的双生成器框架,在多领域图像到图像翻译中超越现有的多模型或共享生成器方法?
- RQ2与 StarGAN 等共享生成器模型相比,将翻译和重建解耦为独立生成器是否能提升训练稳定性和生成质量?
- RQ3不同优化损失(颜色循环一致性、SSIM 和身份损失)对 G2GAN 框架的性能和稳定性有何影响?
- RQ4两个生成器之间不同参数共享程度对模型容量和生成质量有何影响?
- RQ5G2GAN 是否能通过单一统一模型在人脸、风景和建筑等多样化领域实现最先进性能?
主要发现
- G2GAN 在 Facades、AR 和 Bu3dfe 数据集上取得最佳 FID 分数,标签到照片翻译的 Turkers 准确率为 23.6%,照片到标签翻译为 55.625%,优于 StarGAN 和其他基线模型。
- 消融实验表明,移除身份损失(All - I)后,性能分别下降至 2.6% 和 4.2% 的 Turkers 准确率,表明其在身份保持方面至关重要。
- 采用双判别器的变体(All - D)分别取得 9.0% 和 5.3% 的 Turkers 准确率,显示其稳定性优于完整模型,尽管与其他损失结合时性能有所下降。
- G2GAN 所用参数量显著更少(53.2M–61.6M),远低于 CycleGAN(52.6M×21)、DualGAN(178.7M×21)和 StarGAN(53.2M×1),同时实现更优或相当的性能。
- 完整 G2GAN 模型在标签到照片翻译任务上取得 10.3% 的 Turkers 准确率,在 AR 数据集上为 22.8%,展现出在多样化领域中的强大性能。
- 无参数共享的模型(G2GAN no-sharing)参数量达 61.6M,AR 数据集上准确率为 2.1%,表明参数共享对性能至关重要,但模型仍具竞争力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。