[论文解读] SINE: SINgle Image Editing with Text-to-Image Diffusion Models
SINE 提出了一种新颖的方法,利用预训练的文本到图像扩散模型实现单图像编辑,通过引入基于模型的无分类器指导和基于图像块的微调。该方法实现了高保真度、与分辨率无关的图像编辑,保持内容一致性并实现语言引导的操控,即使仅使用单张输入图像也能实现,克服了先前方法中常见的过拟合和几何失真问题。
Recent works on diffusion models have demonstrated a strong capability for conditioning image generation, e.g., text-guided image synthesis. Such success inspires many efforts trying to use large-scale pre-trained diffusion models for tackling a challenging problem--real image editing. Works conducted in this area learn a unique textual token corresponding to several images containing the same object. However, under many circumstances, only one image is available, such as the painting of the Girl with a Pearl Earring. Using existing works on fine-tuning the pre-trained diffusion models with a single image causes severe overfitting issues. The information leakage from the pre-trained diffusion models makes editing can not keep the same content as the given image while creating new features depicted by the language guidance. This work aims to address the problem of single-image editing. We propose a novel model-based guidance built upon the classifier-free guidance so that the knowledge from the model trained on a single image can be distilled into the pre-trained diffusion model, enabling content creation even with one given image. Additionally, we propose a patch-based fine-tuning that can effectively help the model generate images of arbitrary resolution. We provide extensive experiments to validate the design choices of our approach and show promising editing capabilities, including changing style, content addition, and object manipulation. The code is available for research purposes at https://github.com/zhang-zx/SINE.git .
研究动机与目标
- 解决使用预训练文本到图像扩散模型进行单图像编辑的挑战,因为现有方法存在过拟合和几何失真问题。
- 在实现风格迁移、对象操控和分辨率缩放等多样化编辑的同时,保持内容和结构的一致性。
- 克服现有方法的局限性,这些方法需要同一对象的多张图像,或在任意分辨率下失效。
- 开发一种框架,利用大规模预训练模型的泛化能力,同时基于单张参考图像进行编辑。
- 实现通过语言引导的编辑,保持在多样化编辑任务中身份和空间一致性。
提出的方法
- 引入基于模型的无分类器指导,即在去噪早期步骤中,由在单张图像上微调的扩散模型提供梯度指导,以保持内容和结构。
- 采用两阶段去噪过程:首先由过拟合模型提供早期指导以嵌入内容,随后使用条件为文本提示的预训练模型进行后期编辑。
- 采用基于图像块的微调,将空间位置与内容解耦,实现在无需重新训练的情况下生成任意分辨率的图像。
- 利用无分类器指导,并引入可学习的指导权重 $v$,以平衡对参考图像的保真度与来自预训练模型的创造力。
- 采用混合采样策略:在去噪早期阶段,由微调模型指导预训练模型,随后由预训练模型在语言条件引导下接管。
- 使用文本描述符定义目标内容,结合语言提示引导期望的编辑,实现风格迁移、对象添加等多样化编辑任务。

实验结果
研究问题
- RQ1单图像编辑方法是否能在仅使用一张参考图像的情况下,保持内容保真度并实现多样化编辑?
- RQ2在单张图像上微调扩散模型时,如何缓解过拟合问题?
- RQ3预训练的文本到图像扩散模型是否能被微调模型有效指导,以保持身份和结构一致性?
- RQ4该方法是否能生成无伪影或几何失真的高分辨率图像?
- RQ5在保持原始图像空间布局的前提下,语言引导在操控内容、风格和对象身份方面能实现多大程度的灵活性?
主要发现
- 该方法在仅修改风格、添加内容或改变对象的情况下,仍能实现高保真度编辑,且保持身份和结构一致性。
- 基于图像块的微调使模型能够在任意分辨率下生成图像,例如从一幅 512×512 的《戴珍珠耳环的少女》画作中生成 640×512 的雕塑图像。
- 指导权重 $v=0.7$ 在保真度与创造力之间提供了良好平衡,最小化伪影并保持高 LPIPS 和 CLIP 分数。
- 该方法成功实现了复杂编辑,如内容移除、风格生成和双模型风格迁移,展现出在多样化编辑任务中的鲁棒性。
- 与先前方法相比,SINE 减少了过拟合和几何伪影,在真实场景图像(如人脸和复杂场景)中表现出更稳定的性能。
- 在保持空间一致性和泛化能力方面,该方法优于现有方法,尤其在高分辨率编辑或使用模糊语言提示时表现更优。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。