Skip to main content
QUICK REVIEW

[论文解读] Score-based Continuous-time Discrete Diffusion Models

Haoran Sun, Lijun Yu|arXiv (Cornell University)|Nov 30, 2022
Model Reduction and Neural Networks被引用 7
一句话总结

本文提出基于分数的连续时间离散扩散模型(SDDM),通过连续时间马尔可夫跳跃过程将基于分数的生成建模扩展至类别离散数据。提出类别比率匹配以实现无偏分数估计与解析反向采样,在图像与音乐生成基准上实现最先进性能,且采样步数更少。

ABSTRACT

Score-based modeling through stochastic differential equations (SDEs) has provided a new perspective on diffusion models, and demonstrated superior performance on continuous data. However, the gradient of the log-likelihood function, i.e., the score function, is not properly defined for discrete spaces. This makes it non-trivial to adapt extcolor{\cdiff}{the score-based modeling} to categorical data. In this paper, we extend diffusion models to discrete variables by introducing a stochastic jump process where the reverse process denoises via a continuous-time Markov chain. This formulation admits an analytical simulation during backward sampling. To learn the reverse process, we extend score matching to general categorical data and show that an unbiased estimator can be obtained via simple matching of the conditional marginal distributions. We demonstrate the effectiveness of the proposed method on a set of synthetic and real-world music and image benchmarks.

研究动机与目标

  • 将基于分数的生成建模扩展至类别离散变量,其中由于不可微性,传统分数函数未定义。
  • 利用随机跳跃过程与连续时间马尔可夫链,为离散数据制定连续时间扩散过程。
  • 提出一种可处理、无偏的学习目标——类别比率匹配,用于估计离散空间中的反向过程。
  • 通过基于条件边际分布的解析模拟,实现高效且精确的反向采样。
  • 在合成数据、图像与音乐生成任务上展示该方法的有效性,提升生成样本质量与采样效率。

提出的方法

  • 提出连续时间马尔可夫跳跃过程,用于建模离散空间中的反向去噪过程,实现一致的SDE公式化。
  • 引入类别比率匹配作为基于分数的学习目标,将Hyvärinen的比率匹配推广至类别数据。
  • 通过匹配条件边际分布,推导出分数函数的无偏估计器,避免使用ELBO近似。
  • 基于隐式建模条件边际分布,开发解析反向采样方法,实现无需数值积分的精确模拟。
  • 提出一种新颖的“中空”神经架构,提升高维离散数据建模的效率与容量。
  • 在解析采样不可行时,采用预测-校正方案进行数值采样,确保鲁棒性。

实验结果

研究问题

  • RQ1基于分数的建模能否在类别离散数据上实现有意义的扩展,其中分数函数不可微?
  • RQ2如何利用随机跳跃过程为离散变量构建连续时间扩散过程?
  • RQ3何种学习目标可实现离散空间中反向过程的无偏、可处理估计?
  • RQ4能否为离散连续时间扩散模型推导出解析反向采样方法?其与数值方法相比表现如何?
  • RQ5所提出方法在真实世界离散数据基准(如图像与音乐)上的表现如何,尤其在减少采样步数时?

主要发现

  • 在CIFAR-10上,SDDM仅用100步采样即达到13.29的Fréchet Inception Distance(FID),优于相同条件下D3PM的62.15 FID。
  • 使用250步采样时,SDDM达到FID 12.50与Inception Score(IS)8.80,显著优于D3PM(FID: 32.61,IS: 7.71)。
  • 在单音音乐生成任务中,SDDM实现Hellinger距离0.3736 ± 0.0024与异常值比例0.1093 ± 0.0016,优于先前方法。
  • SDDM的解析采样器即使在仅20步时仍保持高质量生成(FID: 21.06),相比D3PM展现出更优鲁棒性。
  • 所提出的“中空”Transformer架构可有效建模高维离散数据(如含129个token的音乐序列)。
  • 类别比率匹配实现无偏学习,无需依赖ELBO近似,相比先前离散扩散方法提升估计质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。