Skip to main content
QUICK REVIEW

[论文解读] Exploration in Deep Reinforcement Learning: From Single-Agent to Multiagent Domain

Jianye Hao, Tianpei Yang|arXiv (Cornell University)|Sep 14, 2021
Reinforcement Learning in Robotics参考文献 200被引用 13
一句话总结

本文对深度强化学习(DRL)和多智能体强化学习(MARL)中的探索方法进行了全面综述,将方法分类为基于不确定性的和基于内在动机的两类。它在基准测试中提供了统一的实证比较,并识别出在复杂环境中实现样本高效探索的开放性挑战与未来研究方向。

ABSTRACT

Deep Reinforcement Learning (DRL) and Deep Multi-agent Reinforcement Learning (MARL) have achieved significant successes across a wide range of domains, including game AI, autonomous vehicles, robotics, and so on. However, DRL and deep MARL agents are widely known to be sample inefficient that millions of interactions are usually needed even for relatively simple problem settings, thus preventing the wide application and deployment in real-industry scenarios. One bottleneck challenge behind is the well-known exploration problem, i.e., how efficiently exploring the environment and collecting informative experiences that could benefit policy learning towards the optimal ones. This problem becomes more challenging in complex environments with sparse rewards, noisy distractions, long horizons, and non-stationary co-learners. In this paper, we conduct a comprehensive survey on existing exploration methods for both single-agent and multi-agent RL. We start the survey by identifying several key challenges to efficient exploration. Beyond the above two main branches, we also include other notable exploration methods with different ideas and techniques. In addition to algorithmic analysis, we provide a comprehensive and unified empirical comparison of different exploration methods for DRL on a set of commonly used benchmarks. According to our algorithmic and empirical investigation, we finally summarize the open problems of exploration in DRL and deep MARL and point out a few future directions.

研究动机与目标

  • 为解决深度强化学习(DRL)和多智能体强化学习(MARL)中因探索能力不足而导致的样本效率低下这一关键挑战。
  • 系统性地将DRL与MARL中的现有探索方法按照两大核心范式进行分类与分析:基于不确定性的方法与基于内在动机的方法。
  • 在标准DRL基准上对探索方法进行统一的实证评估,实现性能与效率的直接比较。
  • 识别当前探索技术在稀疏奖励、高时序跨度以及非平稳多智能体设置下的关键局限与开放性问题。
  • 通过提出未来研究的有前景方向,为提升复杂现实世界RL应用中探索效率提供指导。

提出的方法

  • 将探索方法主要划分为两类:基于不确定性的(如后验知识不确定性、价值函数中的不确定性)与基于内在动机的(如好奇心、内在信用分配)。
  • 提出一个统一的分析框架,利用互信息最大化与变分推断来形式化内在动机与技能发现。
  • 采用状态边际匹配(SMM)以促进技能发现中对未知状态的覆盖,解决智能体过度关注已知状态的问题。
  • 在标准DRL基准(如Atari、MuJoCo)上使用一致的训练协议评估方法,以实现公平比较。
  • 引入自模仿学习(SIL)作为补充方法,使智能体通过模仿自身过去的成功轨迹来提升学习效率。
  • 使用变分下界来近似状态与技能之间的互信息,从而实现可扩展且可微分的探索目标。

实验结果

研究问题

  • RQ1基于不确定性的方法与基于内在动机的方法在处理稀疏奖励与长时序任务方面的能力有何差异?
  • RQ2在具有非平稳共同学习者的多智能体设置中,现有探索方法的关键局限是什么?
  • RQ3互信息最大化与状态边际匹配在多大程度上能改善探索中的状态空间覆盖?
  • RQ4自模仿学习与轨迹级模仿相较于基于内在奖励的方法,在样本效率方面表现如何?
  • RQ5DRL与MARL中高效探索的开放性问题与未来研究方向是什么?

主要发现

  • 基于不确定性的方法(如后验知识不确定性估计)在早期探索中表现优异,但可能因信用分配延迟而在长时序任务中表现不佳。
  • 基于内在动机的方法(如好奇心与内在信用分配)显著提升了样本效率,尤其在稀疏奖励环境中。
  • 在EDL中引入的状态边际匹配(SMM)即使在先前方法失效的环境中,也能实现对状态空间的覆盖性技能发现,归因于其保持均匀状态访问的能力。
  • 自模仿学习(SIL)及其变体(如DTSIL、ESIL)在稀疏奖励领域中优于标准的异策略方法,因其能重用成功轨迹。
  • 实证评估表明,结合内在动机与价值函数正则化或基于好奇心的探索方法在Atari与MuJoCo基准上取得了最佳性能。
  • 尽管已有进展,当前方法在MARL中的非平稳性方面仍存在困难,共同学习者策略在训练过程中发生漂移,导致探索不稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。