Skip to main content
QUICK REVIEW

[论文解读] Exploration Conscious Reinforcement Learning Revisited

Lior Shani, Yonathan Efroni|arXiv (Cornell University)|Dec 13, 2018
Reinforcement Learning in Robotics被引用 5
一句话总结

本文通过针对固定探索机制(如ε-greedy或高斯噪声)优化策略,而非将探索视为外部扰动,提出了探索意识强化学习。其将问题形式化为求解一个代理马尔可夫决策过程(surrogate MDP),在表格型和深度强化学习设置中均实现了更稳定且样本高效的训练,在Atari和MuJoCo环境中的实验结果也显示了性能提升。

ABSTRACT

The Exploration-Exploitation tradeoff arises in Reinforcement Learning when one cannot tell if a policy is optimal. Then, there is a constant need to explore new actions instead of exploiting past experience. In practice, it is common to resolve the tradeoff by using a fixed exploration mechanism, such as $ε$-greedy exploration or by adding Gaussian noise, while still trying to learn an optimal policy. In this work, we take a different approach and study exploration-conscious criteria, that result in optimal policies with respect to the exploration mechanism. Solving these criteria, as we establish, amounts to solving a surrogate Markov Decision Process. We continue and analyze properties of exploration-conscious optimal policies and characterize two general approaches to solve such criteria. Building on the approaches, we apply simple changes in existing tabular and deep Reinforcement Learning algorithms and empirically demonstrate superior performance relatively to their non-exploration-conscious counterparts, both for discrete and continuous action spaces.

研究动机与目标

  • 解决标准强化学习算法将探索视为固定外部机制所导致的局限性,从而引发次优策略学习的问题。
  • 形式化探索意识优化准则,使所得到的策略在给定探索方案下达到最优。
  • 将探索意识策略学习问题转化为求解代理MDP,从而实现系统化的算法设计。
  • 通过将探索意识整合到现有算法中,证明在表格型和深度强化学习设置下,样本效率与鲁棒性均得到提升。

提出的方法

  • 针对离散与连续动作空间,定义探索意识准则,作为在由固定探索机制诱导的受限策略集上的优化问题。
  • 构建一个代理MDP,其最优策略对应于原始MDP的探索意识最优策略。
  • 提出两种通用算法方法——基于值函数与基于策略的方法,用于求解探索意识优化问题。
  • 通过修改目标网络或策略更新方式,将探索意识整合到现有表格型与深度强化学习算法(如DQN、SAC)中,以考虑探索机制。
  • 使用当前策略与固定探索策略的加权组合来定义新的目标Q值,从而在探索约束下实现稳定学习。
  • 在较弱假设下证明所提算法的收敛性,表明误差随时间衰减,且策略收敛至探索意识最优策略。

实验结果

研究问题

  • RQ1我们能否定义一种系统化的优化准则,使策略在固定探索机制下达到最优,而非假设探索与策略学习相互独立?
  • RQ2如何将探索意识策略学习问题转化为标准MDP形式,以实现可计算的求解?
  • RQ3在探索意识学习中,相对于真实最优策略的偏差与对近似误差的敏感性之间存在何种权衡?
  • RQ4我们能否设计出实用算法,在价值函数与策略更新中显式引入探索意识,从而超越标准强化学习方法?
  • RQ5探索意识学习是否能在离散与连续控制任务中均实现更高的样本效率与性能表现?

主要发现

  • 通过代理MDP形式化推导出的探索意识策略,相对于真实最优策略存在偏差,但对函数近似误差的敏感性显著降低。
  • 在Atari环境中,所提方法在性能上优于标准DQN与Rainbow智能体,尤其在稀疏奖励设置下表现更优。
  • 在MuJoCo连续控制任务中,探索意识SAC变体在样本效率与最终回报方面优于标准SAC,尤其在训练初期阶段优势明显。
  • 在标准假设下,所提算法的收敛性可被理论保证,误差衰减速率与折扣因子γ及探索权重α成比例。
  • 实验结果表明,探索意识学习可有效缓解在Cliff-Walking等环境中性能下降的问题,避免标准ε-greedy导致的危险行为。
  • 该方法在表格型与深度强化学习设置中均具有良好的泛化能力,无需架构修改,仅需在目标更新中引入探索机制,即可实现一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。