Skip to main content
QUICK REVIEW

[论文解读] Generative Modelling With Inverse Heat Dissipation

Severi Rissanen, Markus Heinonen|arXiv (Cornell University)|Jun 21, 2022
Generative Adversarial Networks and Image Synthesis被引用 11
一句话总结

本文提出逆热耗散模型(IHDM),一种新颖的类似扩散的生成模型,通过反向求解热方程,从粗略的平均表示中随机重建高分辨率细节以生成图像。该模型通过谱分析和对含噪声热方程的变分推理解释,利用图像固有的多尺度结构,实现了颜色与形状的解耦生成、平滑插值以及改进的数据效率。

ABSTRACT

While diffusion models have shown great success in image generation, their noise-inverting generative process does not explicitly consider the structure of images, such as their inherent multi-scale nature. Inspired by diffusion models and the empirical success of coarse-to-fine modelling, we propose a new diffusion-like model that generates images through stochastically reversing the heat equation, a PDE that locally erases fine-scale information when run over the 2D plane of the image. We interpret the solution of the forward heat equation with constant additive noise as a variational approximation in the diffusion latent variable model. Our new model shows emergent qualitative properties not seen in standard diffusion models, such as disentanglement of overall colour and shape in images. Spectral analysis on natural images highlights connections to diffusion models and reveals an implicit coarse-to-fine inductive bias in them.

研究动机与目标

  • 为解决标准扩散模型缺乏显式多尺度归纳偏差的问题,这些模型未显式建模自然图像的层次结构。
  • 探究是否可通过反向求解热方程——一种自然抹除细粒度细节的偏微分方程——作为具有涌现解耦性和平滑性的原则化生成过程。
  • 探讨前向热过程如何使学习到的生成函数趋于简化,从而可能提升数据效率。
  • 通过自然图像的谱分析揭示标准扩散模型中隐含的自粗至细归纳偏差。
  • 证明逆热耗散过程可生成高质量、多样化的图像,同时支持对颜色和形状等属性的可控解耦。

提出的方法

  • 前向过程使用热方程 ∂u/∂t = Δu 逐步平滑并平均图像数据,随时间将其投影到低维、粗略的表示中。
  • 反向过程通过变分推理框架随机反转热方程,其中加入小量加法噪声的解被解释为潜在变量模型中的近似后验。
  • 基于训练数据的核密度估计用于建模粗略平均图像上的先验分布,从而实现高效采样。
  • 生成过程通过数值方案实现,该方案在拉普拉斯算子的特征基中应用逆热算子,以提高计算效率。
  • 在反向过程中引入采样噪声以稳定不适定的逆问题,数据集默认值为 δ = 1.25 × σ。
  • 通过固定采样噪声并仅改变初始粗略图像先验,实现颜色与形状的解耦,从而实现对全局颜色和结构形状的独立控制。

实验结果

研究问题

  • RQ1反向求解热方程能否作为原则化、可微的生成过程,以捕捉自然图像的多尺度特性?
  • RQ2逆热耗散过程是否能导致全局图像属性(如颜色和形状)的涌现解耦?
  • RQ3自然图像的谱结构如何与标准扩散模型的归纳偏差相关联?与所提出的IHDM有何不同?
  • RQ4前向热过程在多大程度上简化了生成模型必须学习的函数?这对数据效率有何影响?
  • RQ5IHDM能否在实现高质量图像生成的同时,支持对颜色和形状等图像属性的可控、解耦操作?

主要发现

  • 通过固定采样噪声并仅调节初始粗略先验,IHDM实现了整体颜色与图像形状的解耦生成,展示了可控属性编辑能力。
  • 该模型在生成样本之间表现出平滑插值,表明潜在空间具有良好的连续性。
  • 对自然图像的谱分析表明,标准扩散模型隐式执行了一种自粗至细的生成过程,但其归纳偏差与IHDM不同,后者通过热方程显式建模尺度空间。
  • 前向热过程使生成函数趋于简化,表现为模型即使在数据有限的情况下也能学习到有效的映射,暗示其具有潜在的数据效率优势。
  • 在MNIST数据集上,即使采用确定性采样(δ = 0),模型表现依然良好,表明对噪声水平具有鲁棒性;而更高噪声水平最终导致性能下降,证实了最优噪声调度的重要性。
  • IHDM生成的样本在欧氏距离上通常比标准扩散模型更接近训练数据,表明其对训练分布结构的重建更为忠实。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。