[论文解读] Generative Flow Networks for Discrete Probabilistic Modeling
本文提出了基于能量的生成流网络(EB-GFN),一种联合学习框架,可同时训练生成流网络(GFlowNet)采样器与能量函数,用于高维离散概率建模。通过利用GFlowNet的组合结构,EB-GFN实现了高效的大型区块MCMC提议,能够在不同模式间混合,从而在MNIST和动态MNIST等离散数据上取得最先进性能。
We present energy-based generative flow networks (EB-GFN), a novel probabilistic modeling algorithm for high-dimensional discrete data. Building upon the theory of generative flow networks (GFlowNets), we model the generation process by a stochastic data construction policy and thus amortize expensive MCMC exploration into a fixed number of actions sampled from a GFlowNet. We show how GFlowNets can approximately perform large-block Gibbs sampling to mix between modes. We propose a framework to jointly train a GFlowNet with an energy function, so that the GFlowNet learns to sample from the energy distribution, while the energy learns with an approximate MLE objective with negative samples from the GFlowNet. We demonstrate EB-GFN's effectiveness on various probabilistic modeling tasks. Code is publicly available at https://github.com/zdhNarsil/EB_GFN.
研究动机与目标
- 解决在具有明显分离模式的高维离散分布建模中,MCMC方法混合缓慢的问题。
- 克服由于复杂能量景观中MCMC探索不足而导致的能量模型(EBM)中虚假模式的问题。
- 通过类似对比发散的损失函数,实现生成流网络(GFlowNet)与能量函数的联合训练,使用GFlowNet生成的负样本。
- 利用GFlowNets的组合结构,在不依赖潜在结构先验知识的前提下,发现并泛化于数据模式。
- 开发一种可扩展的端到端框架,用于离散概率建模,将昂贵的MCMC探索过程摊销为固定数量的GFlowNet操作。
提出的方法
- 将离散数据上的非自回归序列生成建模为GFlowNet,通过部分状态DAG上的前向(绘制)和反向(擦除)随机策略实现。
- 利用GFlowNet的前向与反向策略构建Metropolis-Hastings MCMC的马尔可夫链提议,实现跨模式的大规模、低拒绝率跳跃。
- 通过对比损失联合训练GFlowNet与能量函数:能量函数使用GFlowNet生成的负样本来更新,而GFlowNet则被训练为从能量分布中采样。
- 使用回放缓冲区与PCD风格训练(PCD-100)以稳定学习过程,模型选择基于验证集NLL。
- 确保在GFlowNet充分收敛的条件下,联合训练过程能估计真实数据对数似然梯度。
- 将该框架应用于二值化MNIST和合成结构化数据等离散数据,使用轨迹流对未归一化密度进行建模。
实验结果
研究问题
- RQ1能否将GFlowNet调整为从数据中学习而非从固定能量函数中学习,从而实现采样器与能量模型的联合训练?
- RQ2基于GFlowNet的MCMC提议能否近似大型区块Gibbs采样,并显著改善离散分布中明显分离模式之间的混合性能?
- RQ3GFlowNet与能量函数的联合训练是否能在离散数据上实现优于现有EBM基线的对数似然性能?
- RQ4GFlowNets的组合结构是否能在无显式结构先验或长低概率路径的情况下,实现模式间的泛化?
- RQ5所提出的框架在真实世界离散数据(如二值化图像和结构化序列)上是否具备可扩展性与有效性?
主要发现
- EB-GFN在测试的四个数据集中的三个上实现了最先进水平的负对数似然(NLL)性能,优于GWG基线。
- 在Dynamic MNIST数据集上,EB-GFN生成的样本在模式覆盖和细节保真度方面优于Gibbs采样与GWG,尤其在捕捉稀有或复杂模式方面表现更优。
- 基于GFlowNet的MCMC提议可实现高效的跨模式大跳跃,显著缩短混合时间,优于标准的局部MCMC方法。
- 使用GFlowNet生成的负样本来进行联合训练,稳定了EBM训练过程,并缓解了传统EBM训练中常见的虚假模式问题。
- 该框架在具有复杂多模态结构的合成数据集上表现出色,表明其对组合模式爆炸具有鲁棒性。
- 训练好的GFlowNet本身即可作为强大的生成模型,无需依赖MCMC即可生成高质量样本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。