Skip to main content
QUICK REVIEW

[论文解读] Efficient exploration with Double Uncertain Value Networks

Thomas M. Moerland, Joost Broekens|arXiv (Cornell University)|Nov 29, 2017
Reinforcement Learning in Robotics参考文献 33被引用 14
一句话总结

本文提出双不确定值网络(DUVN),一种深度强化学习方法,通过贝叶斯丢弃和贝尔曼方程中的高斯分布传播,联合建模参数不确定性(源于数据有限)和回报不确定性(源于随机回报)。通过结合两种不确定性并使用汤普森采样进行探索,DUVN 在具有挑战性的探索环境中显著提升了学习效率,在链状环境(Chain domain)中优于标准的 $\epsilon$-greedy 和无向方法,同时在标准 Gym 环境中表现相当或更优。

ABSTRACT

This paper studies directed exploration for reinforcement learning agents by tracking uncertainty about the value of each available action. We identify two sources of uncertainty that are relevant for exploration. The first originates from limited data (parametric uncertainty), while the second originates from the distribution of the returns (return uncertainty). We identify methods to learn these distributions with deep neural networks, where we estimate parametric uncertainty with Bayesian drop-out, while return uncertainty is propagated through the Bellman equation as a Gaussian distribution. Then, we identify that both can be jointly estimated in one network, which we call the Double Uncertain Value Network. The policy is directly derived from the learned distributions based on Thompson sampling. Experimental results show that both types of uncertainty may vastly improve learning in domains with a strong exploration challenge.

研究动机与目标

  • 为解决强化学习中的探索-利用权衡问题,通过建模两类独立的不确定性来源:源于数据有限的参数不确定性,以及源于随机回报的回报不确定性。
  • 开发一种深度神经网络架构,联合估计这两种类型的不确定性,以提升探索能力。
  • 证明结合两种不确定性可实现比无向方法(如 $\epsilon$-greedy 或玻尔兹曼探索)更高效的探索。
  • 展示所提方法可仅通过最小改动集成到现有深度 Q-网络中,利用贝叶斯丢弃和高斯输出分布。
  • 在高探索挑战环境(如链状环境)和标准 OpenAI Gym 环境中验证该方法的有效性。

提出的方法

  • 通过测试时应用丢弃的贝叶斯神经网络建模参数不确定性,以近似后验预测分布。
  • 通过将高斯分布传播至贝尔曼更新方程,建模回报不确定性,表示状态-动作对回报的分布。
  • 将两种不确定性整合进单一深度神经网络,称为双不确定值网络(DUVN),其输出包含值估计的均值和方差。
  • 使用汤普森采样从学习到的分布中直接推导策略,实现基于不确定性的合理探索。
  • 通过修改标准深度 Q-网络实现 DUVN:添加用于贝叶斯推理的丢弃层,并将仅输出均值的头替换为高斯分布输出头。
  • 使用标准深度强化学习算法进行训练,损失函数同时考虑参数不确定性和回报不确定性。

实验结果

研究问题

  • RQ1在单一深度网络中联合建模参数不确定性和回报不确定性,是否能提升强化学习中的探索效率?
  • RQ2与 $\epsilon$-greedy 等无向探索方法相比,联合建模不确定性来源在样本效率和最终性能方面表现如何?
  • RQ3所提方法是否能在高探索挑战环境(如链状环境)中显著优于现有方法?
  • RQ4DUVN 框架是否与标准深度 Q-网络实现向后兼容,仅需极少的架构修改?
  • RQ5贝叶斯丢弃与高斯贝尔曼传播的结合,是否比单独使用任一方法更具鲁棒性和有效性?

主要发现

  • 在链状环境(一个极具挑战性的探索环境)中,DUVN 显著优于 $\epsilon$-greedy 和无向探索方法。
  • 在标准 OpenAI Gym 环境中,DUVN 表现与无向探索方法相当或更优,表明其在多样化环境中具有持续的改进效果。
  • 该方法能有效区分未尝试的动作(高参数不确定性)与次优动作(低不确定性),实现更智能的探索。
  • 利用贝叶斯丢弃建模参数不确定性,结合高斯分布传播建模回报不确定性,可在单一神经网络中实现准确且高容量的不确定性估计。
  • 基于联合不确定性分布的汤普森采样,可生成自然平衡探索与利用的策略,无需引入启发式探索奖励。
  • 实现 DUVN 仅需对现有深度 Q-网络进行微小修改——添加丢弃层和高斯输出头——使其可轻松集成至当前强化学习流程中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。