Skip to main content
QUICK REVIEW

[论文解读] Conditional Image Generation with Score-Based Diffusion Models

Georgios Batzolis, Jan Stanczuk|arXiv (Cornell University)|Nov 26, 2021
Generative Adversarial Networks and Image Synthesis参考文献 19被引用 8
一句话总结

本文提出了一种基于得分扩散模型的多速率扩散框架,用于条件图像生成,引入了一种新颖的条件多速率扩散估计器(CMDE),统一了现有方法。该方法为条件去噪估计器提供了理论依据,并在超分辨率、图像修复和边缘到图像转换任务中实现了最先进性能,同时开源了MSDiff库以支持可复现性和进一步研究。

ABSTRACT

Score-based diffusion models have emerged as one of the most promising frameworks for deep generative modelling. In this work we conduct a systematic comparison and theoretical analysis of different approaches to learning conditional probability distributions with score-based diffusion models. In particular, we prove results which provide a theoretical justification for one of the most successful estimators of the conditional score. Moreover, we introduce a multi-speed diffusion framework, which leads to a new estimator for the conditional score, performing on par with previous state-of-the-art approaches. Our theoretical and experimental findings are accompanied by an open source library MSDiff which allows for application and further research of multi-speed diffusion models.

研究动机与目标

  • 系统比较和分析基于得分的扩散模型在条件图像生成中的应用。
  • 为广泛使用但此前未经形式化验证的条件去噪估计器提供理论依据。
  • 开发一种多速率扩散框架,实现对条件得分的新统一估计器。
  • 在超分辨率、图像修复和边缘到图像转换等基准任务上评估所提方法。
  • 发布开源库MSDiff,以支持条件生成与多速率扩散模型的进一步研究。

提出的方法

  • 提出一种多速率扩散框架,其中图像的不同空间区域以不同速率扩散,从而实现对噪声注入的局部控制。
  • 引入条件多速率扩散估计器(CMDE),通过建模扩散图像与条件的联合得分来估计条件得分。
  • 采用随机微分方程(SDE)公式,统一连续时间下的基于得分与基于扩散的生成建模。
  • 使用共享得分模型,输入为扩散图像与条件的拼接,通过改进架构以处理联合得分估计。
  • 采用指数移动平均(EMA)和先前工作的标准训练协议,以稳定训练过程。
  • 通过一致的架构与超参数,在多个条件图像生成任务中进行验证,确保公平比较。

实验结果

研究问题

  • RQ1如何有效适应基于得分的扩散模型用于条件图像生成,哪些估计器能取得最佳性能?
  • RQ2条件去噪估计器的理论依据是什么?尽管其在实践中被广泛使用,但此前缺乏正式验证。
  • RQ3多速率扩散框架是否能通过实现空间自适应的噪声调度,提升条件得分估计?
  • RQ4在多样化的条件生成任务中,所提出的CMDE估计器与现有方法相比,在图像质量和似然估计方面表现如何?
  • RQ5多速率扩散在训练效率与模型表达能力方面,对条件图像生成具有哪些实际影响?

主要发现

  • 在温和的正则性条件下,条件去噪估计器被理论证明是条件得分的一致估计器。
  • 所提出的CMDE估计器在超分辨率、图像修复和边缘到图像转换任务中均达到与最先进方法相当的性能。
  • 多速率扩散框架通过允许空间可变的噪声调度,实现了对条件分布更灵活、更丰富的建模。
  • 实证结果表明,CMDE估计器在多样化条件图像生成基准上泛化能力出色,性能优于或匹配先前方法。
  • 开源库MSDiff促进了研究的可复现性,并支持未来在条件与多速率扩散模型方向的探索。
  • 理论分析证实,随着噪声方差减小,CMDE估计器收敛至真实条件得分,收敛速率取决于光滑性假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。