[论文解读] The Blessing of Randomness: SDE Beats ODE in General Diffusion-based Image Editing
本文提出了一种基于随机微分方程(SDEs)的统一概率框架,用于基于扩散模型的图像编辑,证明SDE在编辑保真度和对齐性方面始终优于ODE。通过将编辑建模为通过SDE而非ODE进行的潜在变量操作,该方法在图像修复、图像翻译和基于点的拖拽等任务中均实现了更优性能,其中SDE-Drag在新基准(DragBench)上显著优于包括DragGAN和DiffEdit-ODE在内的基线方法。
We present a unified probabilistic formulation for diffusion-based image editing, where a latent variable is edited in a task-specific manner and generally deviates from the corresponding marginal distribution induced by the original stochastic or ordinary differential equation (SDE or ODE). Instead, it defines a corresponding SDE or ODE for editing. In the formulation, we prove that the Kullback-Leibler divergence between the marginal distributions of the two SDEs gradually decreases while that for the ODEs remains as the time approaches zero, which shows the promise of SDE in image editing. Inspired by it, we provide the SDE counterparts for widely used ODE baselines in various tasks including inpainting and image-to-image translation, where SDE shows a consistent and substantial improvement. Moreover, we propose SDE-Drag -- a simple yet effective method built upon the SDE formulation for point-based content dragging. We build a challenging benchmark (termed DragBench) with open-set natural, art, and AI-generated images for evaluation. A user study on DragBench indicates that SDE-Drag significantly outperforms our ODE baseline, existing diffusion-based methods, and the renowned DragGAN. Our results demonstrate the superiority and versatility of SDE in image editing and push the boundary of diffusion-based editing methods.
研究动机与目标
- 为从理论角度理解基于扩散的图像编辑,解决缺乏统一概率框架的问题。
- 探究尽管性能相近,为何基于SDE的方法在图像编辑中可能优于基于ODE的对应方法。
- 开发一种实用且高效的基于SDE的点拖拽方法,避免在潜在空间中进行迭代优化。
- 评估基于SDE的编辑方法在开放集图像(包括真实图像、艺术作品和AI生成内容)上的泛化能力和鲁棒性。
- 建立一个新基准(DragBench),用于在真实、开放集条件下评估图像编辑方法。
提出的方法
- 提出一种统一的概率公式化方法,将编辑建模为特定任务的潜在变量操作,随后使用新的SDE或ODE进行采样,与原始模型的SDE/ODE相分离。
- 理论上证明,随着时问趋近于零,SDE边际分布之间的Kullback-Leibler(KL)散度减小,而ODE则不会,从而为SDE的优越性提供了理论依据。
- 开发SDE-Drag,一种简单的方法,通过SDE动力学直接在潜在空间中复制和粘贴内容点,避免多步优化。
- 引入一个新的超参数β以控制编辑强度,其中β=0.3在拖拽任务中表现最优,β=1在复制任务中表现最优。
- 采用多步SDE采样过程,结合学习到的漂移函数,引导潜在变量向目标编辑方向演化,同时保持图像质量。
- 构建DragBench,一个包含100张开放集图像(自然图像、艺术作品和AI生成图像)的挑战性基准,用于在多样化、未见条件下评估编辑方法。
实验结果
研究问题
- RQ1为何基于SDE的图像编辑方法在实践中优于基于ODE的方法,尽管两者均源自同一预训练扩散模型?
- RQ2能否建立一个统一的概率公式化方法,以泛化至包括图像修复、图像到图像翻译和基于点的拖拽在内的多样化基于扩散的编辑任务?
- RQ3SDE的理论优势——即随时间推移KL散度减小——是否能转化为图像编辑质量与对齐性的可测量提升?
- RQ4一种简单、非优化驱动的SDE方法(SDE-Drag)能否在基于点的内容拖拽任务中实现最先进性能,相比现有依赖优化或基于GAN的方法?
- RQ5基于SDE的编辑方法在开放集图像(包括Stable Diffusion和DALL·E 3等先进扩散模型生成的图像)上的泛化能力如何?
主要发现
- 在DragBench基准上,SDE-Drag在用户偏好评分上显著优于ODE基线、现有基于扩散的方法(如DiffEdit-ODE)以及DragGAN。
- 在DiffEdit任务中,SDE-Drag在t₀=0.3时达到7.20的FID分数,优于ODE基线(7.67 FID),且在所有t₀值下均保持一致的性能提升。
- 在图像到图像翻译任务中,DDIB-SDE的图像保真度高于DDIB-ODE,视觉对比和定量指标均显示其优势。
- SDE-Drag成功编辑了来自DALL·E 3和Stable Diffusion的图像,即使原始提示词缺失(例如,将闪电拖拽到马克杯中),也表现出强大的提示-图像对齐能力。
- 该方法在开放集图像上泛化良好,包括真实照片、艺术作品和AI生成内容,但对高度分布外的内容仍存在失败案例。
- 消融实验确认β=0.3为拖拽任务的最优值,β=1为复制任务的最优值,且在多个随机种子下表现稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。