Skip to main content
QUICK REVIEW

[论文解读] Explicit Explore-Exploit Algorithms in Continuous State Spaces

Mikael Henaff|arXiv (Cornell University)|Nov 1, 2019
Reinforcement Learning in Robotics被引用 14
一句话总结

该论文提出了一种基于模型的强化学习算法,通过维护一组动力学模型,在连续或大规模状态空间中显式分离探索与利用阶段。该算法通过最大化模型预测之间的分歧进行探索,利用优化后的模型进行利用,实现了在结构复杂度度量下的样本效率可证明的样本复杂度为多项式,通过神经网络进行了实证验证。

ABSTRACT

We present a new model-based algorithm for reinforcement learning (RL) which consists of explicit exploration and exploitation phases, and is applicable in large or infinite state spaces. The algorithm maintains a set of dynamics models consistent with current experience and explores by finding policies which induce high disagreement between their state predictions. It then exploits using the refined set of models or experience gathered during exploration. We show that under realizability and optimal planning assumptions, our algorithm provably finds a near-optimal policy with a number of samples that is polynomial in a structural complexity measure which we show to be low in several natural settings. We then give a practical approximation using neural networks and demonstrate its performance and sample efficiency in practice.

研究动机与目标

  • 开发一种适用于大规模或连续状态空间的样本高效强化学习算法,以替代在这些场景下失效的表格方法。
  • 通过识别能最大化一组一致动力学模型之间分歧的策略,实现系统性探索。
  • 证明该算法在可实现性和最优规划假设下,能在结构复杂度度量(模型误配矩阵的秩)的多项式样本复杂度内找到近似最优策略。
  • 提供一种基于神经网络的实用实现,确保在真实环境中保持样本效率。

提出的方法

  • 维护一组与观察经验一致的动力学模型,并在收集新数据时持续更新。
  • 通过求解一个虚构的马尔可夫决策过程(MDP)进行探索,其中状态为模型状态的拼接,奖励为模型预测之间的分布分歧(如KL散度)。
  • 使用距离度量δ(如KL散度或总变差距离)量化模型预测在时间步上的分歧程度。
  • 当无策略能引发足够分歧时,切换至利用阶段,选择单一模型以最大化累积奖励进行规划。
  • 采用神经网络近似动力学模型,并在利用阶段使用DQN或PPO进行策略优化。
  • 使用回放缓冲区存储探索阶段的轨迹,并利用收集的数据对模型进行监督学习微调。

实验结果

研究问题

  • RQ1基于模型分歧的显式探索是否能在连续或大规模状态空间中实现样本高效的强化学习?
  • RQ2在可实现性和最优规划假设下,此类算法的样本复杂度由何种结构复杂度度量所决定?
  • RQ3在高维或无限状态空间中,集合成员之间的模型分歧如何引导有效探索?
  • RQ4基于神经网络的算法近似是否能在实际中保持样本效率?
  • RQ5在连续控制和导航任务中,该算法与基于内在好奇心或RND的探索方法相比表现如何?

主要发现

  • 该算法的样本复杂度在模型误配矩阵的秩上为多项式,而该秩在自然场景(如因子化MDP和低秩MDP)中通常较低。
  • 在迷宫环境中,采用DQN进行利用的Neural-E3智能体在误导性奖励设计下表现优于基于MCTS的规划,原因在于搜索偏差更小。
  • 在连续控制任务中,Neural-E3结合DQN取得了优异性能,利用阶段在75万次DQN更新中使用了探索阶段收集的经验。
  • 模型分歧度量有效识别了未探索区域:在迷宫任务中,模型在第28步前保持一致,但在第29步出现分歧,标志着关键探索节点。
  • 该算法对奖励设计具有鲁棒性,在稀疏或欺骗性奖励环境中优于基线方法。
  • 超参数调优表明,优先回放和合适的学习率对训练稳定性至关重要,而参数噪声未提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。