[论文解读] ControlCom: Controllable Image Composition using Diffusion Model
ControlCom 提出了一种统一的扩散模型,用于可控图像合成,通过二维指示向量控制光照和姿态,整合了图像混合、调和、视角合成和生成式构图。通过采用两阶段特征融合策略——先全局后局部的嵌入融合并结合对齐的特征调制,该方法在前景保真度和可控性方面表现优越,在公开数据集和真实世界基准上均优于现有方法。
Image composition targets at synthesizing a realistic composite image from a pair of foreground and background images. Recently, generative composition methods are built on large pretrained diffusion models to generate composite images, considering their great potential in image generation. However, they suffer from lack of controllability on foreground attributes and poor preservation of foreground identity. To address these challenges, we propose a controllable image composition method that unifies four tasks in one diffusion model: image blending, image harmonization, view synthesis, and generative composition. Meanwhile, we design a self-supervised training framework coupled with a tailored pipeline of training data preparation. Moreover, we propose a local enhancement module to enhance the foreground details in the diffusion model, improving the foreground fidelity of composite images. The proposed method is evaluated on both public benchmark and real-world data, which demonstrates that our method can generate more faithful and controllable composite images than existing approaches. The code and model will be available at https://github.com/bcmi/ControlCom-Image-Composition.
研究动机与目标
- 为解决现有基于扩散模型的图像合成方法在可控性方面的不足,特别是针对前景属性(如光照和姿态)的选择性调节问题。
- 通过增强在扩散生成过程中常被丢失的纹理和外观细节,提升前景身份保留能力。
- 将四种相关图像合成任务——混合、调和、视角合成与生成式构图——统一为一个条件扩散模型。
- 设计一种自监督训练框架,并配备定制化的数据准备流程,以实现多种合成任务的联合训练。
- 设计一种两阶段特征融合机制,以同时提升生成合成图的全局一致性和局部细节保真度。
提出的方法
- 引入二维指示向量作为条件控制输入,指定是否应调整前景的光照或姿态,从而实现对四种合成任务的统一处理。
- 设计一种自监督训练框架,利用单一统一架构联合训练模型在图像混合、调和、视角合成与生成式构图上的表现。
- 提出一种两阶段特征融合策略:首先融合全局前景嵌入以生成粗粒度合成图,然后融合局部嵌入以细化纹理和外观细节。
- 从局部嵌入构建对齐的前景嵌入图,并用于调制扩散模型中的中间特征,从而增强局部细节保真度。
- 通过预训练图像编码器同时对背景和前景图像进行条件控制,扩散过程由指示向量和融合后的嵌入共同引导。
- 通过定制化数据准备流程生成训练数据,模拟所有四种任务的真实合成场景,支持端到端的自监督学习。

实验结果
研究问题
- RQ1一个单一的扩散模型是否能有效在共享架构下统一处理图像混合、调和、视角合成与生成式构图?
- RQ2二维控制向量在不降低身份一致性或真实感的前提下,能在多大程度上实现对前景属性(光照和姿态)的选择性操控?
- RQ3与同时或单阶段融合相比,两阶段融合策略(先全局后局部)是否能提升前景细节保真度?
- RQ4在前景保真度、背景保留和整体图像质量方面,该方法与最先进基线方法相比表现如何?
- RQ5该模型是否能泛化到真实世界合成场景,而不仅限于精心筛选的基准数据集?
主要发现
- 在 COCOEE 基准上,ControlCom 的 Composition 版本取得了最佳 FID(3.19)和 QS(77.84),在整体质量上优于 PbE 和 ObjectStitch。
- Blending 版本取得了最高的 CLIP_{fg} 得分(90.63),表明前景身份保留能力更优,同时保持了出色的背景一致性。
- Harmonization 和 View Synthesis 版本在 LPIPS 和 LSSIM 得分上与 PbE 和 ObjectStitch 相当或更优,显示出更强的视觉协调性与真实感。
- 定性结果表明,ControlCom 显著优于文本引导或基线扩散模型,在保留前景纹理和外观细节方面表现更佳。
- 用户研究与视觉对比证实,ControlCom 能够实现对光照和姿态的精确、可控编辑,生成更自然、更真实的合成图像。
- 该模型在真实世界数据上表现出良好的泛化能力,经 FOSCom 新建数据集验证,展现出超越合成基准的鲁棒性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。