Skip to main content
QUICK REVIEW

[论文解读] Variational Inference with Tail-adaptive f-Divergence

Dilin Wang, Hao Liu|arXiv (Cornell University)|Oct 29, 2018
Adversarial Robustness in Machine Learning被引用 20
一句话总结

本文提出了一种尾部自适应 f-散度用于变分推断,该方法根据重要性权重的尾部分布动态调整凸函数 f,确保矩的有限性与优化的稳定性,同时保持质量覆盖特性。该方法在贝叶斯神经网络和深度强化学习中显著提升了性能,优于标准 KL 散度与 α-散度方法,尤其在多模态与高维设置下表现更优。

ABSTRACT

Variational inference with α-divergences has been widely used in modern probabilistic machine learning. Compared to Kullback-Leibler (KL) divergence, a major advantage of using α-divergences (with positive α values) is their mass-covering property. However, estimating and optimizing α-divergences require to use importance sampling, which could have extremely large or infinite variances due to heavy tails of importance weights. In this paper, we propose a new class of tail-adaptive f-divergences that adaptively change the convex function f with the tail of the importance weights, in a way that theoretically guarantees finite moments, while simultaneously achieving mass-covering properties. We test our methods on Bayesian neural networks, as well as deep reinforcement learning in which our method is applied to improve a recent soft actor-critic (SAC) algorithm. Our results show that our approach yields significant advantages compared with existing methods based on classical KL and α-divergences.

研究动机与目标

  • 为解决在变分推断中由于重要性权重重尾导致 α-散度估计不稳定的挑战。
  • 开发一种在确保梯度估计方差有限的同时保持质量覆盖特性的方法。
  • 在训练过程中根据密度比的尾部分布自适应选择散度行为。
  • 通过用标准 KL 散度与 α-散度目标的替代,改进贝叶斯神经网络与深度强化学习中的变分推断。
  • 提供一种理论基础坚实的自适应 f-散度,能够根据经验权重分布动态调整 f 函数。

提出的方法

  • 提出一类新的 f-散度,根据密度比 w = p(x)/q(x) 的经验尾部分布自适应调整凸函数 f。
  • 通过重要性权重的秩变换定义分段凸 f-函数,避免在高尾区域发生爆炸。
  • 应用重参数化梯度的随机优化,实现变分近似端到端的训练。
  • 推导出一种新的变分推断算法(算法 1),在每个梯度步骤中根据当前 w 的分布动态更新 f。
  • 通过将策略更新中的 KL 散度替换为尾部自适应 f-散度,将该方法适配至软演员评论家(SAC)算法。
  • 采用联合分布公式化方法,将策略更新重述为 qπ 与 pQ 之间散度最小化问题,从而在强化学习中更广泛地应用 f-散度。

实验结果

研究问题

  • RQ1f-散度能否根据重要性权重的尾部分布实现动态自适应,以确保矩的有限性与估计的稳定性?
  • RQ2尾部自适应 f-散度是否在提升估计稳定性的同时,仍保持 α-散度的质量覆盖特性?
  • RQ3该自适应散度能否改善具有多模态后验分布的贝叶斯神经网络中的变分推断?
  • RQ4该方法能否在深度强化学习中提升样本效率与最终性能,特别是在多模态决策制定场景下?
  • RQ5在复杂、高维环境中,该自适应 f-散度相较于固定 α-散度与基于 KL 散度的方法,性能表现如何?

主要发现

  • 所提出的尾部自适应 f-散度确保了重要性权重的矩有限,消除了梯度估计中无限方差的风险。
  • 在贝叶斯神经网络中,该方法相比标准 KL 散度与 α-散度能更准确地恢复真实后验的多个模式。
  • 在 MuJoCo 环境中,该方法在最终平均奖励上优于原始 SAC(α=0)与所有测试的 α-散度变体,尤其在 Ant 与 Humanoid 等复杂任务中表现更优。
  • 在大多数环境中,该自适应方法的收敛速度优于所有基线方法,并实现了更高的渐近性能。
  • 在高维、多模态设置下,性能提升最为显著,证明了该方法在复杂后验结构中的有效性。
  • 实证结果证实,该方法能够更高效地优化深度强化学习中的多模态损失函数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。