Skip to main content
QUICK REVIEW

[论文解读] Remember What You have drawn: Semantic Image Manipulation with Memory

Xiangxi Shi, Zhonghua Wu|arXiv (Cornell University)|Jul 27, 2021
Multimodal Machine Learning Applications参考文献 22被引用 5
一句话总结

该论文提出 MIM-Net,一种基于记忆的图像操作网络,通过学习的潜在记忆将图像特征解耦为纹理和结构表征,实现符合文本描述的逼真图像编辑。通过引入重建阶段、目标定位单元(TLU)以及随机化记忆训练损失,MIM-Net 在四个数据集上均实现了更优的背景保留效果与真实感,其在语义相关性、背景质量与图像质量方面优于先前方法。

ABSTRACT

Image manipulation with natural language, which aims to manipulate images with the guidance of language descriptions, has been a challenging problem in the fields of computer vision and natural language processing (NLP). Currently, a number of efforts have been made for this task, but their performances are still distant away from generating realistic and text-conformed manipulated images. Therefore, in this paper, we propose a memory-based Image Manipulation Network (MIM-Net), where a set of memories learned from images is introduced to synthesize the texture information with the guidance of the textual description. We propose a two-stage network with an additional reconstruction stage to learn the latent memories efficiently. To avoid the unnecessary background changes, we propose a Target Localization Unit (TLU) to focus on the manipulation of the region mentioned by the text. Moreover, to learn a robust memory, we further propose a novel randomized memory training loss. Experiments on the four popular datasets show the better performance of our method compared to the existing ones.

研究动机与目标

  • 为解决现有文本到图像操作模型在背景保留与真实纹理生成方面的局限性。
  • 减少在编辑过程中混合纹理与结构特征所导致的结构失真。
  • 通过利用学习的记忆表征,提升文本描述与图像特征之间的跨模态对齐。
  • 开发一个鲁棒的记忆模块,仅捕捉相关纹理信息,避免对无关背景特征的过拟合。
  • 通过包含重建与对抗性记忆学习的两阶段训练过程,提升模型泛化能力与编辑保真度。

提出的方法

  • MIM-Net 将图像特征解耦为结构边界图与存储在可学习记忆向量集合中的纹理表征。
  • 引入重建阶段,仅使用记忆特征来重建输入图像,以训练记忆模块,从而提升记忆质量与相关性。
  • 目标定位单元(TLU)生成注意力图,使模型聚焦于文本中提及的对象区域,减少背景干扰。
  • 复合损失函数结合记忆级别的对抗性损失与伪真实标签损失,确保记忆向量具备鲁棒性与语义意义。
  • 模型使用预训练词嵌入作为文本输入,并从记忆中检索对应图像特征,而非依赖直接的文本-图像融合。
  • TLU 的特征图用于控制记忆访问,确保仅使用相关纹理信息进行操作。

实验结果

研究问题

  • RQ1与端到端模型相比,基于记忆的架构是否能提升文本引导图像操作的真实感与保真度?
  • RQ2如何训练记忆模块,使其仅存储相关纹理特征,同时忽略背景与结构细节?
  • RQ3目标定位单元(TLU)在图像操作中能在多大程度上提升编辑定位精度并减少背景失真?
  • RQ4包含重建与对抗性记忆学习的两阶段训练过程是否能生成更鲁棒且泛化能力更强的记忆表征?
  • RQ5所提出方法在多样数据集与复杂编辑指令下,背景一致性保持效果如何?

主要发现

  • MIM-Net 在所有评估维度上均优于 ManiGAN 与基线模型,在 67 名测试者参与的人工评估中,语义相关性平均得分为 4.4,背景质量为 4.3,图像质量为 4.2。
  • 消融研究显示,移除记忆模块会导致局部细节生成较差,如模糊的牙齿与头发,而加入记忆模块可显著提升真实感。
  • TLU 使模型能够聚焦于相关区域:例如,当描述中未提及‘眼睛’与‘鼻子’时,模型会突出显示‘嘴巴’、‘颧骨’与‘发际线’。
  • 伪真实标签损失(ℒp)有助于保持物体结构,减少伪影并提升生成结果的一致性。
  • 重建阶段使模型能够学习更具意义的记忆表征,表现为在包含记忆损失时,颈部与面颊区域的空白区域显著减少。
  • 最终模型可生成高分辨率(256×256)图像,凭借 FIR 模块清晰呈现局部细节与修复边缘,如花瓣边界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。