Skip to main content
QUICK REVIEW

[论文解读] MHER: Model-based Hindsight Experience Replay

Rui Yang, Meng Fang|arXiv (Cornell University)|Jul 1, 2021
Reinforcement Learning in Robotics参考文献 32被引用 13
一句话总结

MHER 提出了一种基于模型的 hindsight experience replay 框架,通过利用学习到的动力学模型生成虚拟达成目标,从而在多目标强化学习中提升样本效率,实现更有效的目标重标记。该方法将强化学习与基于模型生成的重标记数据上的目标条件监督学习相结合,相较于以往的无模型和基于模型的方法,在稀疏奖励环境中实现了更优的样本效率。

ABSTRACT

Solving multi-goal reinforcement learning (RL) problems with sparse rewards is generally challenging. Existing approaches have utilized goal relabeling on collected experiences to alleviate issues raised from sparse rewards. However, these methods are still limited in efficiency and cannot make full use of experiences. In this paper, we propose Model-based Hindsight Experience Replay (MHER), which exploits experiences more efficiently by leveraging environmental dynamics to generate virtual achieved goals. Replacing original goals with virtual goals generated from interaction with a trained dynamics model leads to a novel relabeling method, model-based relabeling (MBR). Based on MBR, MHER performs both reinforcement learning and supervised learning for efficient policy improvement. Theoretically, we also prove the supervised part in MHER, i.e., goal-conditioned supervised learning with MBR data, optimizes a lower bound on the multi-goal RL objective. Experimental results in several point-based tasks and simulated robotics environments show that MHER achieves significantly higher sample efficiency than previous model-free and model-based multi-goal methods.

研究动机与目标

  • 解决在稀疏奖励下多目标强化学习中样本效率低下的挑战。
  • 克服现有目标重标记方法仅依赖真实采集轨迹的局限性。
  • 利用学习到的环境动力学生成虚拟达成目标,以实现更有效的经验重标记。
  • 开发一种结合强化学习与基于模型重标记数据的监督学习的联合训练框架。
  • 通过理论证明所提方法优化了原始多目标强化学习目标的下界,从而提供理论依据。

提出的方法

  • 提出基于模型的重标记(MBR),利用训练好的动力学模型从与环境的交互中生成虚拟达成目标。
  • 通过使用动力学模型滚动执行当前策略,生成虚拟轨迹,产生带有重标记目标的伪示范数据。
  • 在 MBR 生成的数据上应用目标条件监督学习,以提升策略的泛化能力与样本效率。
  • 构建联合损失函数,结合 MBR 数据上的强化学习损失与监督学习损失,实现端到端策略优化。
  • 理论分析证明,最小化 MBR 数据上的监督学习损失可优化原始多目标强化学习目标的下界。
  • 利用动力学模型在无需真实环境交互的情况下模拟未来状态与目标,从而降低数据收集成本。

实验结果

研究问题

  • RQ1基于模型生成的虚拟目标是否能提升稀疏奖励下多目标强化学习的样本效率?
  • RQ2将监督学习与 MBR 生成的数据结合,是否能带来优于标准 HER 或无模型基线的策略性能?
  • RQ3在联合强化学习与监督学习框架中使用 MBR 数据是否有理论依据?
  • RQ4MHER 在样本效率方面与最先进的基于模型和无模型多目标强化学习方法相比如何?
  • RQ5MHER 是否能通过避免在完全虚拟状态上训练,保持对模型误差的鲁棒性?

主要发现

  • 在基于点的环境和 Mujoco 环境中,MHER 的样本效率显著优于 HER、Curriculum-guided HER、Maximum Entropy-based Prioritization 和 Goal-Conditioned Supervised Learning。
  • 在 Point2DLarge 和 Point2D-FourRoom 环境中,MHER 达成目标所需的环境交互次数显著少于基线方法。
  • 在 FetchReach 和 SawyerReachXYZ 任务中,MHER 在样本效率方面优于先前方法,尤其在稀疏奖励设置下表现更优。
  • 消融实验表明,结合基于模型的重标记与监督学习,相比仅使用强化学习,能显著提升学习速度与最终性能。
  • MHER 通过仅从真实数据生成目标,避免在完全虚拟状态上训练,从而保持对模型误差的鲁棒性。
  • 该方法在多种环境(包括具有复杂动力学的连续控制任务)中均表现出一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。