[论文解读] Bayesian Flow Networks
贝叶斯流网络(BFNs)提出了一种新颖的生成建模框架,该框架利用迭代贝叶斯推断来更新先验分布,随后通过神经网络生成相互依赖的输出分布。该方法在text8字符级语言建模任务上取得了最先进结果,达到1.41比特/字符,优于所有已知的离散扩散模型,同时在离散领域实现了可微分的、基于梯度的样本引导。
This paper introduces Bayesian Flow Networks (BFNs), a new class of generative model in which the parameters of a set of independent distributions are modified with Bayesian inference in the light of noisy data samples, then passed as input to a neural network that outputs a second, interdependent distribution. Starting from a simple prior and iteratively updating the two distributions yields a generative procedure similar to the reverse process of diffusion models; however it is conceptually simpler in that no forward process is required. Discrete and continuous-time loss functions are derived for continuous, discretised and discrete data, along with sample generation procedures. Notably, the network inputs for discrete data lie on the probability simplex, and are therefore natively differentiable, paving the way for gradient-based sample guidance and few-step generation in discrete domains such as language modelling. The loss function directly optimises data compression and places no restrictions on the network architecture. In our experiments BFNs achieve competitive log-likelihoods for image modelling on dynamically binarized MNIST and CIFAR-10, and outperform all known discrete diffusion models on the text8 character-level language modelling task.
研究动机与目标
- 开发一种生成建模框架,实现在自然语言等离散数据领域中的端到端可微训练和基于梯度的样本引导。
- 通过引入类似流的连续过程,克服离散扩散模型因离散数据导致的噪声转移不连续性问题。
- 通过推导直接优化压缩效率的损失函数,统一数据压缩与生成建模的原理。
- 通过在单纯形上的连续更新,实现在离散序列中的高效、少步数生成。
- 在连续(图像)和离散(文本)数据上均实现具有竞争力的性能,重点聚焦于语言建模。
提出的方法
- BFNs采用两阶段过程:首先,基于噪声数据样本通过贝叶斯推断更新先验分布,生成后验;其次,将后验参数输入神经网络,生成新的、相互依赖的分布。
- 模型采用基于变分推断原理推导出的连续时间与离散时间损失函数,通过证据下界(ELBO)优化数据压缩。
- 对于离散数据,网络输入位于概率单纯形上,实现了完全可微分性,支持基于梯度的样本引导,这在标准离散扩散模型中不可行。
- 网络架构具有灵活性,无特定限制;本文在语言建模实验中采用24层深度Transformer与GELU激活函数。
- 该方法避免了前向扩散过程,转而依赖迭代贝叶斯更新,逐步优化模型对数据分布的信念。
- 样本生成通过迭代应用网络来更新后验分布实现,从简单先验开始,逐步在多步中优化。

实验结果
研究问题
- RQ1能否为离散数据设计一种连续的、可微分的流过程,以实现基于梯度的样本引导和少步数生成?
- RQ2基于贝叶斯推断的分布迭代精炼方法是否在语言建模中优于现有离散扩散模型?
- RQ3该框架能否通过统一的损失函数和训练流程应用于连续、离散化和离散数据?
- RQ4基于变分推断原理推导出的损失函数是否在多种数据类型中均有效于压缩与生成?
- RQ5该模型能否在无需前向扩散过程的情况下,实现在图像和文本基准上的具有竞争力的对数似然性能?
主要发现
- BFNs在text8数据集上实现了1.41比特/字符的测试BPC,优于文献中报告的所有已知离散扩散模型。
- 模型在仅100次生成步骤内达到1.43 BPC,表明其具有强鲁棒性,具备少步推理的潜力。
- BFNs在1.40 BPC的性能上与最佳的无序无关模型(MAC)持平,同时显著优于其他离散扩散模型(其BPC范围为1.45至1.72)。
- 模型在动态二值化MNIST和CIFAR-10上实现了具有竞争力的对数似然性能,证明了其在图像数据上的有效性。
- 使用概率单纯形输入实现了完全可微分性,支持在离散领域中进行基于梯度的样本引导——这是以往离散扩散模型所不具备的能力。
- 训练设置采用24层Transformer,参数量为170M,模型显示出过拟合迹象,表明正则化可能进一步提升性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。