[论文解读] Unpaired Image-to-Image Translation using Adversarial Consistency Loss
本文提出ACL-GAN,一种新颖的无配对图像到图像翻译框架,用对抗一致性损失替代循环一致性损失,以在实现形状变化和物体移除的同时保留关键特征。通过鼓励源图像与翻译图像在分布层面的相似性,而非像素层面的重建,ACL-GAN在无框眼镜移除、男到女面部转换以及自拍到动漫风格转换任务中实现了最先进性能,且生成结果更具真实感和多样性。
Unpaired image-to-image translation is a class of vision problems whose goal is to find the mapping between different image domains using unpaired training data. Cycle-consistency loss is a widely used constraint for such problems. However, due to the strict pixel-level constraint, it cannot perform geometric changes, remove large objects, or ignore irrelevant texture. In this paper, we propose a novel adversarial-consistency loss for image-to-image translation. This loss does not require the translated image to be translated back to be a specific source image but can encourage the translated images to retain important features of the source images and overcome the drawbacks of cycle-consistency loss noted above. Our method achieves state-of-the-art results on three challenging tasks: glasses removal, male-to-female translation, and selfie-to-anime translation.
研究动机与目标
- 为解决无配对图像到图像翻译中循环一致性损失的局限性,该损失强制进行像素级重建,从而保留如眼镜或胡须等不希望保留的特征。
- 实现支持形状修改、物体移除及多模态输出的逼真图像翻译,且无需配对训练数据。
- 提出一种方法,通过分布层面的对齐而非像素层面的身份对齐,保持源图像与目标图像之间的领域共通特征。
- 相比现有的基于循环一致性损失和双生成器的方法,实现更高品质、更多样化且更逼真的翻译结果。
提出的方法
- 提出对抗一致性损失(ACL),鼓励翻译后的图像在共享领域特征上与源图像相似,而无需精确的像素级重建。
- 采用基于生成对抗网络(GAN)的框架,包含一个生成器和一个判别器:生成器将图像从源域翻译到目标域,判别器用于区分真实图像与生成图像。
- 采用受MUNIT启发的风格条件生成器架构,实现内容与风格表征的解耦,支持多模态翻译。
- 将对抗一致性损失与标准对抗损失及身份损失结合,以稳定训练过程并提升特征保留能力。
- 通过预训练的特征提取器(如VGG)在中间层计算源图像与翻译图像之间的特征级相似性,实现一致性度量。
- 无需循环一致性损失或重复的生成器,相比CouncilGAN等方法,显著降低了模型复杂度与计算成本。
实验结果
研究问题
- RQ1对抗一致性损失能否在无配对图像翻译中有效替代循环一致性损失,同时保留关键特征并支持形状变化?
- RQ2所提方法在需要大幅结构变化的任务(如男到女面部转换或自拍到动漫风格迁移)中表现如何?
- RQ3ACL-GAN能否在不使用配对数据的情况下,实现比基于循环一致性损失的模型更优的图像质量与多样性?
- RQ4由于缺乏循环一致性,是否会导致伪影或翻译质量下降?该方法如何缓解此问题?
主要发现
- ACL-GAN在三个具有挑战性的无配对图像翻译任务中达到最先进性能:无框眼镜移除、男到女面部转换以及自拍到动漫风格转换。
- 在男到女面部转换任务中,ACL-GAN生成的面部更具女性特征,无胡须且发丝更长,在定性与定量评估中均优于基于循环一致性损失的模型(如CycleGAN与MUNIT)。
- 在自拍到动漫风格转换任务中,ACL-GAN生成的图像更具风格化且面部特征更规整(如更大眼睛),即使在轻量模式下也优于U-GAT-IT,且参数量不足其一半。
- 该方法能成功移除眼镜及其他大尺寸物体且不留痕迹,而基于循环一致性损失的模型因像素级重建而保留此类特征。
- ACL-GAN在质量上优于CouncilGAN(后者使用重复的生成器与判别器),原因在于其通过对抗一致性损失实现了显式的特征对齐。
- 失败案例包括对不显眼眼镜的移除不完全,以及在输入人脸较小或被遮挡时出现伪影,表明其在处理罕见或复杂输入分布时仍存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。