[论文解读] SDIT: Scalable and Diverse Cross-domain Image Translation
SDIT 通过结合条件实例归一化(CIN)以实现多样性,以及领域条件编码以实现可扩展性,提出了一种统一的生成模型,用于可扩展且多样的跨域图像翻译,在仅使用单一生成器的情况下,实现了在人脸、色彩和场景翻译任务上的最先进性能,其在多样性和可扩展性方面均优于多生成器基线方法。
Recently, image-to-image translation research has witnessed remarkable progress. Although current approaches successfully generate diverse outputs or perform scalable image transfer, these properties have not been combined into a single method. To address this limitation, we propose SDIT: Scalable and Diverse image-to-image translation. These properties are combined into a single generator. The diversity is determined by a latent variable which is randomly sampled from a normal distribution. The scalability is obtained by conditioning the network on the domain attributes. Additionally, we also exploit an attention mechanism that permits the generator to focus on the domain-specific attribute. We empirically demonstrate the performance of the proposed method on face mapping and other datasets beyond faces.
研究动机与目标
- 解决现有无配对图像到图像翻译方法在多样性或可扩展性方面的局限性。
- 在无需配对训练数据的情况下,将可扩展性与多样性统一于单一紧凑的深度学习架构中。
- 使单一模型能够生成多个领域中多样化输出,同时保持高质量的翻译效果。
- 通过潜在空间中的注意力机制,提升领域特定特征的定位能力。
- 展示方法在人脸翻译之外的泛化能力,例如在复杂场景(如照片到艺术风格转换)中的应用。
提出的方法
- 生成器使用条件实例归一化(CIN)层,将随机潜在码注入,从而实现单一模型生成多样化输出。
- 通过将编码器条件化于目标领域标签,实现可扩展性,使单一生成器能够处理多个领域。
- 应用注意力机制以聚焦于领域特定的图像区域,提升特征对齐与翻译保真度。
- 采用 GAN 框架,结合循环一致性损失与身份损失进行训练,以保留内容并增强真实感。
- 将潜在空间解耦为内容与风格两部分,其中风格由服从高斯分布的潜在码控制。
- 该架构为端到端可微分结构,使用无配对图像集合以无监督方式训练。
实验结果
研究问题
- RQ1单一深度生成模型能否在跨域图像翻译中同时实现可扩展性与多样性?
- RQ2在无监督、无配对的图像翻译设置中,如何有效控制多样性?
- RQ3领域条件编码是否能使单一生成器在不降低性能的前提下处理多个领域?
- RQ4基于注意力的特征调制是否能改善翻译中对领域特定属性的定位?
- RQ5所提出方法在多样化数据集上与多生成器基线相比,在定量与定性指标上表现如何?
主要发现
- 在色彩数据集上,SDIT 的平均 LPIPS 为 0.612,优于 CycleGAN(0.592),并匹配 MUNIT(0.608),尽管仅使用一个生成器。
- 在艺术作品数据集上,SDIT 的平均 LPIPS 为 0.828,优于 StarGAN(0.678),并接近真实图像质量(0.869)。
- 在色彩数据集上,SDIT 的反向分类准确率为 97.1%,与 MUNIT(97.2%)相当,显著优于 StarGAN(95.3%)和 CycleGAN(93.5%)。
- 模型可利用单一生成器为同一输入生成跨多个领域的多样化输出(例如,不同色调的黄色、绿色、蓝色鞋子),如定性结果所示。
- 注意力机制通过聚焦于领域特定区域,提升了翻译质量,该结论通过定性对比与消融研究得到验证。
- SDIT 在复杂场景翻译(如照片到西涅风格)中保持强劲性能,实现 65.1% 的平均分类准确率与 0.828 的 LPIPS,优于 StarGAN,并与 MUNIT 表现相当,且仅使用单一模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。