Skip to main content
QUICK REVIEW

[论文解读] Paint by Example: Exemplar-based Image Editing with Diffusion Models

Binxin Yang, Shuyang Gu|arXiv (Cornell University)|Nov 23, 2022
Generative Adversarial Networks and Image Synthesis被引用 8
一句话总结

本文提出了一种基于示例的图像编辑框架,利用扩散模型通过从参考示例图像中学习,实现对图像的精确、高保真语义操作。通过采用信息瓶颈的自监督训练、强数据增强和无分类器指导,该方法避免了复制粘贴伪影,并在野外图像上实现了单次前向传播推理与最先进性能。

ABSTRACT

Language-guided image editing has achieved great success recently. In this paper, for the first time, we investigate exemplar-guided image editing for more precise control. We achieve this goal by leveraging self-supervised training to disentangle and re-organize the source image and the exemplar. However, the naive approach will cause obvious fusing artifacts. We carefully analyze it and propose an information bottleneck and strong augmentations to avoid the trivial solution of directly copying and pasting the exemplar image. Meanwhile, to ensure the controllability of the editing process, we design an arbitrary shape mask for the exemplar image and leverage the classifier-free guidance to increase the similarity to the exemplar image. The whole framework involves a single forward of the diffusion model without any iterative optimization. We demonstrate that our method achieves an impressive performance and enables controllable editing on in-the-wild images with high fidelity.

研究动机与目标

  • 为解决文本引导图像编辑在捕捉难以用语言描述的细粒度视觉细节方面的局限性。
  • 通过允许用户提供示例图像作为语义变换的参考,实现直观、用户友好的图像编辑。
  • 通过引入结构和语义约束,克服自监督训练中直接复制粘贴的平凡解。
  • 在单次前向传播中实现高质量、多样化且可控的图像编辑结果,无需迭代优化。

提出的方法

  • 该方法采用同时以源图像和示例图像为条件的扩散模型,通过使用裁剪区域作为参考的自监督学习进行训练。
  • 通过将示例图像压缩为全局嵌入来应用信息瓶颈,防止模型记忆空间细节,避免复制粘贴伪影。
  • 在训练期间对示例图像应用强数据增强,以减少训练与推理之间的域差距。
  • 在训练中使用任意形状的掩码,以模拟现实世界中的用户画笔笔触,提升对不规则编辑区域的泛化能力。
  • 集成无分类器指导以增强生成区域与示例之间的相似性,提升风格和内容保真度。
  • 整个编辑过程在单次前向传播中完成,实现无需每张图像优化的实时推理。

实验结果

研究问题

  • RQ1基于示例的图像编辑能否在细粒度图像操作中实现比文本引导方法更高的保真度和可控性?
  • RQ2如何设计自监督训练以避免基于示例编辑中的平凡复制粘贴解?
  • RQ3信息瓶颈在扩散模型中如何实现语义理解与空间记忆的解耦?
  • RQ4强数据增强和无分类器指导在基于示例的编辑中在多大程度上提升了泛化能力和视觉质量?
  • RQ5单次前向推理过程能否与基于迭代优化的方法竞争?

主要发现

  • 所提方法在所有变体中取得了最低的FID分数(1.79)和最高的CLIP分数(84.97),证明了其在图像质量和参考相似性方面的卓越表现。
  • 消融研究证实,结合所有技术——先验、增强、瓶颈和无分类器指导——可获得最佳性能,FID从基线的3.61降至3.18。
  • 无分类器指导显著提升了视觉质量和参考相似性,更高的尺度值($\lambda = 5$)使结果更接近示例。
  • 由于扩散模型的随机性,该方法能从同一源图像和示例图像生成多样化、逼真的输出,同时保留关键身份属性(如毛发颜色和耳朵形状)。
  • 该方法在图像质量和一致性方面均优于现有方法,与基线相比FID降低44%,CLIP分数提升25%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。