Skip to main content
QUICK REVIEW

[论文解读] Bayesian Policy Gradients via Alpha Divergence Dropout Inference

Peter Henderson, Thang Doan|arXiv (Cornell University)|Dec 6, 2017
Advanced Bandit Algorithms Research参考文献 16被引用 14
一句话总结

本论文提出使用带有 alpha-散度丢弃推理的贝叶斯神经网络来估计策略梯度强化学习中的值函数分布,取代确定性的值网络。通过利用不确定性感知值函数的蒙特卡洛后验均值估计,该方法在 MuJoCo 连续控制基准测试中显著提升了 PPO、TRPO 和 DDPG 的训练稳定性和性能,部分环境中性能提升高达 34%。

ABSTRACT

Policy gradient methods have had great success in solving continuous control tasks, yet the stochastic nature of such problems makes deterministic value estimation difficult. We propose an approach which instead estimates a distribution by fitting the value function with a Bayesian Neural Network. We optimize an $α$-divergence objective with Bayesian dropout approximation to learn and estimate this distribution. We show that using the Monte Carlo posterior mean of the Bayesian value function distribution, rather than a deterministic network, improves stability and performance of policy gradient methods in continuous control MuJoCo simulations.

研究动机与目标

  • 通过建模值函数估计中的不确定性,解决连续控制中策略梯度方法的高方差与不稳定性问题。
  • 通过用贝叶斯神经网络替代确定性值网络,提升深度强化学习中的学习稳定性和性能。
  • 探究基于丢弃的变分推理实现的不确定性感知值函数估计是否能增强策略梯度算法。
  • 评估贝叶斯值函数近似对 PPO、TRPO 和 DDPG 等广泛使用的算法在连续控制任务中的影响。
  • 探索不确定性在探索与正则化中的作用,特别是在训练初期阶段。

提出的方法

  • 使用贝叶斯神经网络(BNNs)将值函数建模为分布而非点估计。
  • 应用蒙特卡洛丢弃作为变分推理近似,以估计网络权重上的后验分布。
  • 优化 alpha-散度目标,以提升不确定性估计与后验近似精度。
  • 在策略更新过程中使用 BNN 值函数的蒙特卡洛后验均值以稳定学习。
  • 在标准策略梯度框架(PPO、TRPO、DDPG)中集成 BNN 值函数,仅需极少的架构修改。
  • 调整超参数,如丢弃率、蒙特卡洛采样次数以及温度参数 τ,以平衡优化与正则化。

实验结果

研究问题

  • RQ1通过 alpha-散度丢弃实现的贝叶斯值函数估计是否能提升连续控制中策略梯度方法的稳定性和性能?
  • RQ2与确定性值网络相比,使用 BNN 值函数后验均值在学习稳定性和最终回报方面表现如何?
  • RQ3不确定性估计对探索的影响如何,特别是在 PPO 的早期训练阶段?
  • RQ4丢弃率和 τ 等超参数如何影响不同算法的性能与泛化能力?
  • RQ5基于 BNN 的值函数是否能像 Double-DQN 一样减少 Q 值估计的过估计偏差?

主要发现

  • 在 HalfCheetah-v1 环境中,PPO 使用 BNN 值函数的最终平均回报达到 2790 ± 284,显著优于基线(2155 ± 177)和 L2 正则化版本(2030 ± 234),p < 0.05。
  • 在 HalfCheetah-v1 环境中,TRPO 使用 BNN 值函数后性能提升 15%(3026 ± 144 vs. 2605 ± 313),表明学习稳定性得到改善。
  • 在 HalfCheetah-v1 环境中,DDPG 使用 BNN 值函数的最终回报为 4772 ± 736,优于基线(4159 ± 762),且 Q 值过估计现象减少。
  • BNN 方法降低了不同随机种子下的标准误差,表明学习曲线更一致,鲁棒性更强。
  • 消融实验表明,较高的丢弃率和最优 τ 值显著提升了性能,尤其在 PPO 中表现明显,表明探索与正则化能力增强。
  • 由于蒙特卡洛丢弃采样的集成效应,该方法降低了 Q 值估计的方差,类似于 Double-DQN 的效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。