Skip to main content
QUICK REVIEW

[论文解读] Implicit Generative Modeling for Efficient Exploration

Neale Ratzlaff, Qinxun Bai|arXiv (Cornell University)|Nov 19, 2019
Reinforcement Learning in Robotics参考文献 43被引用 4
一句话总结

本文提出了一种新颖的隐式生成建模方法,利用摊销Stein变分梯度下降(amortized Stein Variational Gradient Descent)来近似深度强化学习中环境动态的后验分布。通过从生成器中采样多个神经网络动态模型,该方法通过预测方差估计贝叶斯不确定性,作为内在奖励以实现高效探索。在具有挑战性的稀疏奖励环境中,该方法在数据效率方面优于当前最先进方法。

ABSTRACT

Efficient exploration remains a challenging problem in reinforcement learning, especially for those tasks where rewards from environments are sparse. A commonly used approach for exploring such environments is to introduce some "intrinsic" reward. In this work, we focus on model uncertainty estimation as an intrinsic reward for efficient exploration. In particular, we introduce an implicit generative modeling approach to estimate a Bayesian uncertainty of the agent's belief of the environment dynamics. Each random draw from our generative model is a neural network that instantiates the dynamic function, hence multiple draws would approximate the posterior, and the variance in the future prediction based on this posterior is used as an intrinsic reward for exploration. We design a training algorithm for our generative model based on the amortized Stein Variational Gradient Descent. In experiments, we compare our implementation with state-of-the-art intrinsic reward-based exploration approaches, including two recent approaches based on an ensemble of dynamic models. In challenging exploration tasks, our implicit generative model consistently outperforms competing approaches regarding data efficiency in exploration.

研究动机与目标

  • 为解决深度强化学习中样本效率低下的挑战,特别是在稀疏奖励环境中。
  • 通过建模智能体对环境动态信念中的不确定性,提升探索效率。
  • 开发一种灵活的、非参数化的动态模型后验近似方法,避免对分布形式施加严格假设。
  • 在数据效率和探索覆盖范围方面超越现有的基于内在奖励的探索方法。
  • 通过策略迁移实验,评估该方法在下游密集奖励任务中的可迁移性。

提出的方法

  • 训练一个生成器网络,使用摊销Stein变分梯度下降(SVGD)隐式表示动态模型参数的后验分布。
  • 从生成器中进行的每次随机采样都会生成一个作为动态模型的神经网络,从而通过多个采样近似后验分布。
  • 利用这些采样动态模型之间的预测方差,作为内在奖励信号,以鼓励在不确定的状态-动作区域进行探索。
  • 通过直接最小化隐后验与真实后验之间的KL散度,避免参数化假设和ELBO近似。
  • 该框架在单次训练阶段后即可实现无限次采样,而无需像集成方法那样为每次采样重新训练。
  • 该方法在纯探索和下游任务设置下均进行了评估,包括使用SAC的策略迁移实验。

实验结果

研究问题

  • RQ1与基于集成的方法相比,使用摊销SVG D的隐式生成建模能否为动态模型提供更灵活且高效的后验近似?
  • RQ2与现有基于内在奖励的方法相比,基于隐后验分布估计的不确定性是否能在探索中带来更高的数据效率?
  • RQ3基于此不确定性估计的预训练探索策略,是否能显著提升在密集奖励环境中的下游任务学习性能?
  • RQ4在策略迁移设置下,纯探索阶段的长度如何影响下游任务性能?
  • RQ5该方法在具有稀疏外部奖励的环境中是否具有鲁棒性和有效性?

主要发现

  • 在三个具有挑战性的探索任务中,该方法在数据效率方面持续优于当前最先进基于内在奖励的探索方法。
  • 在策略迁移实验中,使用该方法的探索策略初始化SAC,在100万训练步时表现更优,甚至超越MAX、ICM和Disagreement等方法。
  • 即使仅进行4,000步的纯探索,该方法仍能显著提升下游任务性能,相较于SAC基线,展现出强大的样本效率。
  • 无论是否采用预热设置,该方法在所有基线方法上均表现出明显的优势,证实了其鲁棒性和可迁移性。
  • 消融研究证实,更长的纯探索阶段能进一步提升下游任务学习性能,且性能随探索时长单调递增。
  • 结果表明,通过摊销SVG D实现的隐后验建模,相比基于集成的分歧或不确定性度量,能更有效地估计不确定性以支持探索。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。