Skip to main content
QUICK REVIEW

[论文解读] ObjectStitch: Generative Object Compositing

Yizhi Song, Zhifei Zhang|arXiv (Cornell University)|Dec 2, 2022
Generative Adversarial Networks and Image Synthesis被引用 10
一句话总结

本文提出 ObjectStitch,一种用于生成式物体合成的自监督扩散模型,该模型在单一框架中统一了几何校正、色彩调和、阴影合成与视角合成。通过引入图像引导生成的内容适配器并利用数据增强,该方法在无需任何人工标注的情况下实现了最先进水平的真实感与外观保真度,在真实世界图像的用户研究中优于基线模型。

ABSTRACT

Object compositing based on 2D images is a challenging problem since it typically involves multiple processing stages such as color harmonization, geometry correction and shadow generation to generate realistic results. Furthermore, annotating training data pairs for compositing requires substantial manual effort from professionals, and is hardly scalable. Thus, with the recent advances in generative models, in this work, we propose a self-supervised framework for object compositing by leveraging the power of conditional diffusion models. Our framework can hollistically address the object compositing task in a unified model, transforming the viewpoint, geometry, color and shadow of the generated object while requiring no manual labeling. To preserve the input object's characteristics, we introduce a content adaptor that helps to maintain categorical semantics and object appearance. A data augmentation method is further adopted to improve the fidelity of the generator. Our method outperforms relevant baselines in both realism and faithfulness of the synthesized result images in a user study on various real-world images.

研究动机与目标

  • 解决传统合成流水线存在的局限性,即需要多个独立阶段以及对色彩、光照和阴影进行手动调优。
  • 通过实现完全自监督学习,消除训练数据中昂贵的任务特定标注需求。
  • 将多个合成方面——视角变换、几何校正、色彩调和与阴影生成——统一到一个生成模型中。
  • 通过图像引导的扩散模型而非文本提示,保留输入物体的身份与外观。
  • 通过新颖的内容适配器与数据增强技术,在自监督设置下提升生成保真度。

提出的方法

  • 该框架使用条件扩散模型,由输入物体图像、目标背景以及指定插入位置的边界框进行引导。
  • 内容适配器模块从输入物体中提取多模态嵌入,编码高层语义信息以及颜色、形状等低层细节,以实现图像引导。
  • 生成器模块在保留背景上下文的同时,通过迭代去噪过程合成复合图像,提升真实感。
  • 模型通过合成数据生成与数据增强(包括裁剪和位移增强)实现完全自监督训练。
  • 内容适配器分两个阶段训练:首先学习非自适应嵌入,然后利用实例级特征进行精炼,以改善外观保真度。
  • 评估采用改进的 CLIP 分数,分别设置文本引导(CLIP 文本分数)与图像引导(CLIP 图像分数)的语义匹配指标。

实验结果

研究问题

  • RQ1单一扩散模型能否在无需任务特定监督的情况下,有效统一几何校正、色彩调和、阴影合成与视角合成等多重合成任务?
  • RQ2图像引导的扩散模型在物体合成中,为何能比文本引导的替代方案更好地保留物体身份与外观?
  • RQ3内容适配器模块在合成图像生成中,对保真度与外观保真度的提升程度如何?
  • RQ4数据增强技术在提升自监督合成模型的真实感与细节方面有多有效?
  • RQ5自监督预训练与多阶段微调对生成式合成模型性能的影响如何?

主要发现

  • 在真实世界图像的用户研究中,ObjectStitch 在外观保真度与真实感方面优于基于文本引导的基线模型(如 BLIP 与 SDEdit)。
  • 内容适配器显著提升了生成保真度与语义一致性,消融实验表明,若用 BLIP 替代内容适配器,CLIP 图像分数明显下降。
  • 移除内容适配器或跳过其第二阶段训练会导致性能下降,证实其在学习实例级特征中的关键作用。
  • 数据增强(尤其是裁剪与位移增强)提升了掩码区域覆盖度并增强了细节保真度,若省略则真实感明显下降。
  • 该模型在 FID 与 CLIP 图像分数上均达到最先进水平,证明其在真实感与输入物体语义对齐方面的卓越表现。
  • 该框架成功在掩码物体区域内合成阴影与几何校正,但由于掩码限制,全局效应(如完整阴影传播)仍存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。