[论文解读] Label-Noise Robust Multi-Domain Image-to-Image Translation
本文提出RMIT,一种对标签噪声具有鲁棒性的多域图像到图像翻译模型,能够从带有噪声的训练标签中学习干净标签的条件生成器。通过引入虚拟循环一致性损失和噪声鲁棒分类损失,RMIT在高噪声环境下(例如50%标签翻转)仍能实现接近干净标签模型的性能,且在噪声监督下,其分类准确率和图像质量均优于标准StarGAN。
Multi-domain image-to-image translation is a problem where the goal is to learn mappings among multiple domains. This problem is challenging in terms of scalability because it requires the learning of numerous mappings, the number of which increases proportional to the number of domains. However, generative adversarial networks (GANs) have emerged recently as a powerful framework for this problem. In particular, label-conditional extensions (e.g., StarGAN) have become a promising solution owing to their ability to address this problem using only a single unified model. Nonetheless, a limitation is that they rely on the availability of large-scale clean-labeled data, which are often laborious or impractical to collect in a real-world scenario. To overcome this limitation, we propose a novel model called the label-noise robust image-to-image translation model (RMIT) that can learn a clean label conditional generator even when noisy labeled data are only available. In particular, we propose a novel loss called the virtual cycle consistency loss that is able to regularize cyclic reconstruction independently of noisy labeled data, as well as we introduce advanced techniques to boost the performance in practice. Our experimental results demonstrate that RMIT is useful for obtaining label-noise robustness in various settings including synthetic and real-world noise.
研究动机与目标
- 解决在仅有噪声标签数据可用时训练多域图像到图像翻译模型的挑战,这在现实应用中十分常见。
- 克服现有基于GAN的模型(如StarGAN)在噪声标签下训练时性能退化的问题,后者会导致翻译质量下降和错误的域对齐。
- 开发一个统一框架,学习干净标签条件下的翻译过程,而无需在训练中使用干净标签,从而提升可扩展性和实用性。
- 引入对标签噪声具有鲁棒性的新型损失函数,特别关注循环一致性和分类任务,以在噪声监督下稳定训练。
- 在合成和真实世界标签噪声设置下,证明所提方法的有效性,显示其相对于基线模型的一致性能提升。
提出的方法
- 提出一种虚拟循环一致性损失,通过在输入图像和翻译图像之间强制循环重建,而无需依赖真实标签,从而实现对噪声的鲁棒训练。
- 引入一种标签噪声鲁棒分类损失,减轻训练生成器过程中错误标签的影响,提升特定域生成的保真度。
- 设计一个统一的生成器网络,接收输入图像和目标域标签,即使在噪声监督下,也能基于干净标签生成条件翻译图像。
- 采用双流判别器/分类器头:一个用于真实/虚假区分(对抗损失),一个用于域分类(分类损失),两者均适配以处理标签噪声。
- 应用注意力掩码和颜色掩码,引导生成器聚焦于相关面部区域,从而增强特征解耦和对噪声的鲁棒性。
- 通过结合对抗损失、虚拟循环一致性损失和噪声鲁棒分类损失,端到端训练模型,并对超参数进行调优以实现稳定性和性能的平衡。
实验结果
研究问题
- RQ1当训练期间仅提供噪声标签时,多域图像到图像翻译模型能否学习到干净标签条件下的生成?
- RQ2与标准循环一致性或无循环损失相比,所提出的虚拟循环一致性损失在标签噪声下如何提升性能?
- RQ3标签噪声鲁棒分类损失在多大程度上减轻了误标数据对特定域翻译质量的负面影响?
- RQ4在合成和真实世界标签噪声下,RMIT与标准StarGAN在分类准确率和FID指标上的表现如何比较?
- RQ5在噪声数据上训练时,模型是否能保持内容保留和语义一致性?其如何避免非转换行为?
主要发现
- 在Fer数据集上,RMIT在50%对称标签噪声下达到70.0%的分类准确率(CA),显著优于相同条件下StarGAN的65.5%。
- 在CelebA数据集上,使用非对称噪声(μ=0.3)时,RMIT的CA达到78.9%,而StarGAN仅为60.2%,表明其对标签噪声具有更强的鲁棒性。
- 即使在50%对称标签噪声下,RMIT生成的图像在视觉上与在干净数据上训练的StarGAN生成结果非常接近,而StarGAN则无法学习到有意义的翻译。
- 虚拟循环一致性损失有效实现了无需干净标签的循环重建正则化,从而实现稳定训练并提升图像质量。
- RMIT学习到的注意力掩码比StarGAN更大,表明其更倾向于进行更显著的域特定修改,这与更高的分类准确率相关。
- 在高标签噪声设置下,StarGAN倾向于收敛到非转换模型(即输出与输入相似),而RMIT通过噪声鲁棒训练目标避免了这一失败模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。