Skip to main content
QUICK REVIEW

[论文解读] Open-Edit: Open-Domain Image Manipulation with Open-Vocabulary Instructions

Xihui Liu, Zhe Lin|arXiv (Cornell University)|Aug 4, 2020
Multimodal Machine Learning Applications参考文献 65被引用 7
一句话总结

Open-Edit 是首个利用开放词汇自然语言指令实现开放域图像编辑的框架,通过利用预训练的视觉-语义嵌入空间,在图像特征图上执行文本引导的向量运算。它通过结构感知解码器和具有循环一致性约束的样本特定优化,实现高保真度、细节保留的编辑,在视觉质量和跨多样化图像领域的泛化能力方面优于先前方法。

ABSTRACT

We propose a novel algorithm, named Open-Edit, which is the first attempt on open-domain image manipulation with open-vocabulary instructions. It is a challenging task considering the large variation of image domains and the lack of training supervision. Our approach takes advantage of the unified visual-semantic embedding space pretrained on a general image-caption dataset, and manipulates the embedded visual features by applying text-guided vector arithmetic on the image feature maps. A structure-preserving image decoder then generates the manipulated images from the manipulated feature maps. We further propose an on-the-fly sample-specific optimization approach with cycle-consistency constraints to regularize the manipulated images and force them to preserve details of the source images. Our approach shows promising results in manipulating open-vocabulary color, texture, and high-level attributes for various scenarios of open-domain images.

研究动机与目标

  • 实现无需预定义领域或细粒度标注的开放域图像编辑,克服先前方法在受限领域或标注数据上的局限性。
  • 通过利用从网络获取的弱监督图像-字幕对,减少对昂贵成对训练数据的依赖。
  • 通过样本特定优化和循环一致性正则化,保留编辑后图像的结构和语义细节。
  • 通过可调节的向量运算系数,实现平滑、可控的属性过渡(例如颜色、纹理、语义)。
  • 在无需领域特定微调的情况下,展示在多样化真实世界图像领域中的泛化能力。

提出的方法

  • 利用预训练的视觉-语义嵌入模型(例如 Conceptual Captions 中的模型)将图像和文本指令映射到共享嵌入空间。
  • 通过向量运算实现文本引导的视觉特征编辑:visual_embedding(image) + α × (text_embedding(target) - text_embedding(source))
  • 采用保持结构的图像解码器,利用边缘监督在重建和编辑过程中保持高保真度的图像结构。
  • 应用样本特定优化,学习解码器中的分层扰动,通过重建损失和循环一致性损失进行正则化。
  • 通过双向编辑(例如,红苹果 → 绿苹果 → 红苹果)施加循环一致性约束,以确保身份保持和真实性。
  • 仅通过图像重建监督训练图像解码器,避免对成对编辑图像标注的需求。

实验结果

研究问题

  • RQ1是否可以在无需细粒度标注或成对训练数据的情况下,在开放域设置中实现开放词汇的图像编辑?
  • RQ2如何利用视觉-语义嵌入实现定位准确、指令感知的图像特征编辑?
  • RQ3样本特定优化和循环一致性约束在多大程度上能提升生成编辑的细节保留和真实性?
  • RQ4该框架是否能够支持在多样化图像类型和指令之间实现平滑、可控的属性过渡?
  • RQ5该方法在未见图像领域和复杂自然语言指令上的泛化能力如何?

主要发现

  • 该模型在开放域图像编辑任务中达到最先进水平的视觉质量,用户研究和 LPIPS 分数表明其在真实感和细节保留方面表现更优。
  • 在解码器中引入边缘约束后,结合优化方法,Conceptual Captions 验证集上的 LPIPS 错误率从 0.17 降低至 0.06。
  • 采用循环一致性约束的样本特定优化将 Oxford-102 测试集上的 L2 错误率从 0.19 降低至 0.05,显著提升了重建保真度。
  • 该方法成功实现了对开放域图像中多样化属性(颜色、纹理、语义对象)的编辑,包括人脸编辑和物体替换等复杂情况。
  • 调节系数 α 可实现源属性与目标属性之间的平滑插值,证明了编辑强度的可控性。
  • 定性结果表明,该框架在未见图像领域和指令上具有良好的泛化能力,适用于多样化的真实世界图像。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。