[论文解读] Continuous-Time Functional Diffusion Processes
本文提出了函数扩散过程(fDPs),一种基于先进随机微积分的连续时间框架,将基于得分的扩散模型推广至无穷维函数空间。通过将Girsanov定理和采样定理扩展至希尔伯特空间,fDPs利用简单的MLP或Transformer即可实现图像、音频等连续数据的高保真生成,且参数量相比先前的扩散模型减少数个数量级,达到SOTA性能。
We introduce Functional Diffusion Processes (FDPs), which generalize score-based diffusion models to infinite-dimensional function spaces. FDPs require a new mathematical framework to describe the forward and backward dynamics, and several extensions to derive practical training objectives. These include infinite-dimensional versions of Girsanov theorem, in order to be able to compute an ELBO, and of the sampling theorem, in order to guarantee that functional evaluations in a countable set of points are equivalent to infinite-dimensional functions. We use FDPs to build a new breed of generative models in function spaces, which do not require specialized network architectures, and that can work with any kind of continuous data. Our results on real data show that FDPs achieve high-quality image generation, using a simple MLP architecture with orders of magnitude fewer parameters than existing diffusion models.
研究动机与目标
- 开发一个在连续函数上直接运行、避免离散化误差的理论基础坚实的扩散模型框架。
- 将关键工具如Girsanov定理和采样定理扩展至无穷维希尔伯特空间,以实现严格的变分推断。
- 实现对多样化连续数据模态(如图像、音频、视频)的端到端生成建模,无需专用架构。
- 证明简单的模型(如MLP或Transformer)可通过在连续空间中学习函数得分,实现高质量生成。
- 提供一种统一且可扩展的生成建模方法,支持任意分辨率及无分辨率依赖的生成。
提出的方法
- 提出函数扩散过程(fDPs)作为希尔伯特空间中的连续时间随机过程,将有限维扩散模型推广至函数空间。
- 通过无穷维Girsanov定理的扩展推导证据下界(ELBO),实现对得分函数的变分训练。
- 提出无穷维采样定理,证明在可数个点上的函数取值足以重构完整函数。
- 使用隐式神经表示(INRs)和Transformer联合建模函数值及其得分,实现参数高效的表示。
- 采用适配fDPs随机微分方程(SDEs)的预测-校正数值格式,用于采样与训练。
- 在图像与音频生成任务中直接使用原始连续数据作为输入,无需中间离散化。

实验结果
研究问题
- RQ1能否通过连续时间随机过程,严格地将基于得分的扩散模型扩展至无穷维函数空间?
- RQ2在无穷维希尔伯特空间中,如何推导证据下界(ELBO)以实现对函数得分的变分训练?
- RQ3在函数扩散的背景下,何种数学条件可确保函数能从其在可数个点上的取值完美重构?
- RQ4简单的、非专用的神经架构(如MLP或Transformer)是否能在连续函数空间中实现高质量生成?
- RQ5所提出的框架在无需架构或数据特定调优的情况下,对图像、音频、视频等多样化数据模态的表现如何?
主要发现
- fDPs使用简单MLP实现高保真图像生成,参数量相比现有扩散模型减少数个数量级,展现出极强的参数效率。
- 框架支持无分辨率依赖的生成,如在MNIST数据集上的超分辨率实验表明,单次训练即可生成任意分辨率的图像。
- 在图像修复、去模糊、着色等条件生成任务中,模型生成结果在视觉上连贯,能有效重建缺失或损坏区域并保持语义结构。
- 在Spoken Digit数据集上的初步音频生成实验表明,模型可直接从原始波形生成可理解的语音数字,且波形在感知上与真实样本高度一致。
- 隐式神经表示(INRs)与Transformer的结合,有效实现了对函数值与得分的联合建模,支持灵活且可扩展的函数表示。
- 基于扩展的Girsanov定理与采样定理的理论框架,确保训练目标为有效的ELBO,为无穷维空间中的得分匹配提供原则性替代方案,而非启发式方法。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。