Skip to main content
QUICK REVIEW

[论文解读] Image-to-Image Translation with Text Guidance

Bowen Li, Xiaojuan Qi|arXiv (Cornell University)|Feb 12, 2020
Multimodal Machine Learning Applications参考文献 26被引用 13
一句话总结

本文提出 RefinedGAN,一种基于 GAN 的图像到图像翻译框架,通过整合自然语言描述来控制从语义分割掩码生成的图像中的视觉属性。通过采用词性标注、仿射组合模块、改进的多阶段架构以及结构损失,该模型在 COCO 数据集上实现了卓越的真实感与语义一致性,其在定性和定量评估中均优于先前方法。

ABSTRACT

The goal of this paper is to embed controllable factors, i.e., natural language descriptions, into image-to-image translation with generative adversarial networks, which allows text descriptions to determine the visual attributes of synthetic images. We propose four key components: (1) the implementation of part-of-speech tagging to filter out non-semantic words in the given description, (2) the adoption of an affine combination module to effectively fuse different modality text and image features, (3) a novel refined multi-stage architecture to strengthen the differential ability of discriminators and the rectification ability of generators, and (4) a new structure loss to further improve discriminators to better distinguish real and synthetic images. Extensive experiments on the COCO dataset demonstrate that our method has a superior performance on both visual realism and semantic consistency with given descriptions.

研究动机与目标

  • 通过自然语言描述实现对图像到图像翻译中视觉属性(如颜色、纹理、背景)的精确控制。
  • 解决现有模型依赖像素级语义图且无法控制细粒度属性的局限性。
  • 解耦并准确映射文本中的语义词到生成图像中的对应视觉属性。
  • 在仅使用简单语义分割掩码的前提下,生成高质量、逼真的图像,同时保持与文本提示的语义一致性。
  • 通过架构优化和新颖的结构损失,提升判别器与生成器的性能。

提出的方法

  • 使用词性标注(POS tagging)从文本描述中过滤非语义词汇,减少噪声,并防止无关词汇与视觉特征之间的错误关联。
  • 仿射组合模块(ACM)通过学习模态特定的变换,融合文本与图像特征,实现语义词与图像区域之间的精确对齐。
  • 改进的多阶段架构通过将高阶图像块反馈至低阶阶段进行优化,增强了判别器的差异分辨能力与生成器的校正能力。
  • 该架构使低阶生成器能够生成全局结构与细节,而高阶阶段则负责修正缺失或错误的属性。
  • 引入一种新颖的结构损失,以提升判别器检测伪造图像中细微不一致的能力,从而增强生成器的质量。
  • 完整的 RefinedGAN 框架整合了上述组件,实现基于语义分割掩码与自然语言的逼真且语义一致的图像生成。

实验结果

研究问题

  • RQ1自然语言描述能否有效控制图像到图像翻译中的特定视觉属性(如颜色、纹理、背景)?
  • RQ2如何过滤文本描述中的非语义词汇,以防止图像生成质量下降?
  • RQ3多阶段架构在多大程度上能提升生成图像中视觉属性的解耦与校正能力?
  • RQ4结构损失是否能增强判别器检测细微图像伪影的能力,从而提升生成质量?
  • RQ5所提方法能否在无需详细像素级地图的情况下,从简单语义分割掩码生成逼真且语义一致的图像?

主要发现

  • 消融实验证实,词性标注显著提升了图像质量,通过消除非语义词汇的干扰(如防止在公交车上出现不现实的白色斑块)。
  • 仿射组合模块在特征融合方面优于简单拼接,实现了文本语义与图像区域的精准对齐,同时保持了语义一致性。
  • 改进的多阶段架构有效实现了对缺失或错误属性的校正,例如恢复斑马的头部与背部,或修正公交车上绿色的窗户。
  • 若移除结构损失,将导致图像出现不真实区域(如公交车上的斑块或飞机纹理质量差),证明其在提升判别器对细微缺陷敏感性方面具有关键作用。
  • 完整版 RefinedGAN 模型在 COCO 数据集上生成了具有精细细节且语义一致性强的高质量图像,在定性和定量评估中均优于最先进基线方法。
  • 该模型成功基于简单掩码与文本提示生成了包含多个物体及其关系的复杂场景,如森林中的斑马或灰蒙天空中的黄色喷气机。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。