[论文解读] Two Methods For Wild Variational Inference
该论文提出了两种新型的变分推断方法,无需在推理网络中使用可 tractable 的密度函数,从而实现了通用随机神经采样器的端到端训练。通过利用 Stein 散度和摊销 SVGD,这些方法能够自动学习随机梯度 Langevin 动力学(SGLD)的最优步长,显著优于在高斯混合模型和贝叶斯逻辑回归任务中手动设计的学习率调度方案。
Variational inference provides a powerful tool for approximate probabilistic in- ference on complex, structured models. Typical variational inference methods, however, require to use inference networks with computationally tractable proba- bility density functions. This largely limits the design and implementation of vari- ational inference methods. We consider wild variational inference methods that do not require tractable density functions on the inference networks, and hence can be applied in more challenging cases. As an example of application, we treat stochastic gradient Langevin dynamics (SGLD) as an inference network, and use our methods to automatically adjust the step sizes of SGLD, yielding significant improvement over the hand-designed step size schemes
研究动机与目标
- 为解决变分推断中要求推理网络使用可 tractable 密度函数的问题,该问题限制了模型的灵活性。
- 实现具有不可 tractable 密度的通用推理网络的训练,从而允许自动学习采样过程。
- 开发能够自适应学习 SGLD 最优步长的算法,而无需人工调参。
- 证明野生变分推断在复杂贝叶斯模型中可超越手工设计的学习率调度方案。
提出的方法
- 使用核化 Stein 散度(KSD)来最小化推理网络输出与目标分布之间的散度度量,而无需对提议分布进行密度评估。
- 采用摊销 Stein 变分梯度下降(amortized SVGD)通过减小 KL 散度的方向,迭代调整推理网络参数。
- 应用 U 统计量在小批量设置下估计 KSD,从而实现在大规模数据集上的可扩展优化。
- 将 SGLD 更新视为具有可学习步长的可微分神经网络,通过时间反向传播进行训练。
- 将 SGLD 的结构视为具有 T 个层的深度生成模型,其中每一层对应一次 SGLD 步骤。
- 使用基于网络隐藏状态的参数化步长调度函数,通过基于梯度的优化进行训练。
实验结果
研究问题
- RQ1变分推断能否扩展到具有不可 tractable 密度函数的推理网络,从而实现更灵活和自适应的采样?
- RQ2核化 Stein 散度能否用于训练神经采样器,而无需显式评估提议分布的密度?
- RQ3摊销 SVGD 能否在复杂后验分布中有效学习 SGLD 的最优步长调度?
- RQ4与手工设计的调度方案相比,SGLD 步长的端到端学习在收敛性和准确性方面表现如何?
- RQ5所学习的步长策略能否泛化到未见过的数据集,并在更少迭代次数下保持高性能?
主要发现
- 在 1D 高斯混合模型中,摊销 SVGD 与 KSD 最小化方法在仅使用 20 次 SGLD 步骤的情况下,显著优于恒定步长和幂律衰减步长调度方案,实现了更优的后验覆盖。
- 在 Covertype 数据集上,两种所提方法在测试准确率和似然值上均优于所有手工设计的学习率调度方案,且在更少迭代次数内逼近了完全收敛的 SGLD 和 SVGD 性能。
- 基于 KSD 的训练表现出快速的初期性能提升,随后趋于饱和;而摊销 SVGD 则呈现初期进展较慢,但在后期迭代中出现显著的性能跃升。
- 所学习的步长策略在未见过的测试小批量数据上表现出良好的泛化能力,显示出在不同数据分区间具有鲁棒性和可迁移性。
- 当 T=100 层时,所提方法在准确率和似然值上均达到了接近最优的性能,表明其有效学习了 SGLD 更新的时间动态特性。
- 结果表明,野生变分推断能够实现复杂贝叶斯模型中高效采样过程的自动、自适应和可扩展学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。