[论文解读] Real-World Image Variation by Aligning Diffusion Inversion Chain
本文提出 RIVAL,一种无需训练的推理流水线,通过将扩散模型的去噪链与源图像反演链的潜在分布对齐,生成高质量的真实世界图像变体。通过引入跨图像自注意力注入和逐步潜在归一化,RIVAL 有效减少了域差距,在感知质量和语义一致性方面优于先前方法。
Recent diffusion model advancements have enabled high-fidelity images to be generated using text prompts. However, a domain gap exists between generated images and real-world images, which poses a challenge in generating high-quality variations of real-world images. Our investigation uncovers that this domain gap originates from a latents' distribution gap in different diffusion processes. To address this issue, we propose a novel inference pipeline called Real-world Image Variation by ALignment (RIVAL) that utilizes diffusion models to generate image variations from a single image exemplar. Our pipeline enhances the generation quality of image variations by aligning the image generation process to the source image's inversion chain. Specifically, we demonstrate that step-wise latent distribution alignment is essential for generating high-quality variations. To attain this, we design a cross-image self-attention injection for feature interaction and a step-wise distribution normalization to align the latent features. Incorporating these alignment processes into a diffusion model allows RIVAL to generate high-quality image variations without further parameter optimization. Our experimental results demonstrate that our proposed approach outperforms existing methods concerning semantic similarity and perceptual quality. This generalized inference pipeline can be easily applied to other diffusion-based generation tasks, such as image-conditioned text-to-image generation and stylization.
研究动机与目标
- 解决基于扩散模型的图像变体生成中生成图像与真实世界图像之间的域差距问题。
- 在不需额外训练或参数优化的情况下,提升图像变体的语义和感知质量。
- 利用单张图像样本和文本提示作为语义引导,实现高质量图像生成。
- 开发一种可广泛应用于多种文本到图像生成任务的通用推理流水线。
提出的方法
- 提出一种无需训练的推理流水线 RIVAL,将扩散模型的去噪链与真实图像的反演链对齐。
- 引入跨图像自注意力注入,实现在去噪过程中生成图像与源图像隐藏状态之间的特征交互。
- 应用逐步潜在归一化,将生成链的潜在分布与源图像反演得到的潜在分布对齐。
- 在注意力机制中早期融合参考特征,以保持风格和内容的一致性。
- 采用改进的去噪过程,在保持语义保真度的同时,实现文本条件下的多样化变体生成。
- 利用预训练的 DDPM 模型,无需微调,支持在多种生成任务中即插即用。
实验结果
研究问题
- RQ1如何在基于扩散模型的图像变体生成中减少生成图像与真实世界图像之间的域差距?
- RQ2潜在分布错位在扩散采样过程中对图像质量下降起到何种作用?
- RQ3跨图像注意力与逐步归一化是否能在不微调模型的情况下有效对齐潜在分布?
- RQ4所提出的对齐机制如何提升图像变体的感知质量与语义一致性?
- RQ5RIVAL 流水线在多大程度上可泛化至其他文本到图像生成任务?
主要发现
- 与 DDPM 和文本条件扩散等基线方法相比,RIVAL 显著提升了图像变体的感知质量和语义相似度。
- 该方法在无需任何额外训练或优化的情况下,实现了图像变体生成的最先进性能。
- 逐步潜在归一化有效减少了生成链与反演链之间的分布差异,最小化了域差距。
- 跨图像自注意力注入增强了特征交互,显著提升了生成图像中风格与内容的保留能力。
- 该方法在保持源样本色调、风格和内容一致性的前提下,实现了高质量的文本提示驱动图像生成。
- RIVAL 与概念定制技术(如 DreamBooth)兼容,可无缝实现具有真实世界图像一致性的新概念生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。