[论文解读] Imaginary Hindsight Experience Replay: Curious Model-based Learning for Sparse Reward Tasks
本文提出了一种基于模型的强化学习方法——虚幻后见经验回放(I-HER),该方法将后见经验回放(HER)与基于模型集合的虚拟能 rollout 相结合,以提升稀疏奖励机器人任务中的数据效率。通过在策略训练过程中整合基于好奇心的内在奖励,并明确区分真实与虚拟能 transitions,I-HER 在 OpenAI Gym Fetch 任务中相较于最先进模型无监督方法将样本复杂度降低了整整一个数量级,且在除一项任务外的所有任务中均达到了其渐近性能水平。
Model-based reinforcement learning is a promising learning strategy for practical robotic applications due to its improved data-efficiency versus model-free counterparts. However, current state-of-the-art model-based methods rely on shaped reward signals, which can be difficult to design and implement. To remedy this, we propose a simple model-based method tailored for sparse-reward multi-goal tasks that foregoes the need for complicated reward engineering. This approach, termed Imaginary Hindsight Experience Replay, minimises real-world interactions by incorporating imaginary data into policy updates. To improve exploration in the sparse-reward setting, the policy is trained with standard Hindsight Experience Replay and endowed with curiosity-based intrinsic rewards. Upon evaluation, this approach provides an order of magnitude increase in data-efficiency on average versus the state-of-the-art model-free method in the benchmark OpenAI Gym Fetch Robotics tasks.
研究动机与目标
- 为解决现实世界机器人强化学习中高样本需求及复杂奖励工程的问题。
- 提升在稀疏奖励多目标任务中的样本效率,此类任务难以设计密集奖励。
- 在无需专家示范或复杂奖励塑形的情况下,实现在稀疏奖励环境中的有效探索。
- 通过使用动力学模型集合并在每次模型更新后重新生成虚拟能数据,减少对模型不准确性的过拟合。
- 通过结合基于模型学习的数据效率与 HER 和好奇心的样本效率及鲁棒性,弥合基于模型与无模型强化学习之间的差距。
提出的方法
- I-HER 使用后见经验回放(HER)训练策略,以提升在稀疏奖励多目标强化学习任务中的性能。
- 利用包含 5 个前馈神经网络动力学模型的集合生成虚拟能 rollout,这些模型采用 ReLU 激活函数,且宽度为 512,使用 Adam 优化器进行训练,学习率为 0.001。
- 在每次模型更新后重新生成虚拟能数据,以防止对模型不准确性产生过拟合,提升泛化能力。
- 该集合通过模型间预测差异提供内在奖励,以鼓励探索未访问的状态空间区域。
- 在策略训练过程中,通过二元的 'env_is_real' 信号显式区分真实与虚拟能 transitions,但数据收集阶段将 10% 的真实 rollout 和 10% 的虚拟能 rollout 混合,以提升跨域泛化能力。
- 采用一种混合策略:将 10% 的真实 rollout 输入为 'env_is_real = 0',并将 10% 的虚拟能 rollout 输入为 'env_is_real = 1',以确保虚拟能行为在真实环境中得到校正。
实验结果
研究问题
- RQ1基于模型的强化学习方法是否能在无需密集奖励塑形的情况下,实现在稀疏奖励机器人任务中的高数据效率?
- RQ2将 HER 与基于模型集合的虚拟能 rollout 相结合,对多目标任务中的样本效率和渐近性能有何影响?
- RQ3当与基于模型的 rollout 结合时,基于模型差异的内在奖励是否能通过好奇心提升在稀疏奖励环境中的探索能力?
- RQ4在策略训练过程中显式区分真实与虚拟能数据,对泛化能力及对模型不准确性鲁棒性有何影响?
- RQ5在保持或提升真实世界机器人环境中学习性能的前提下,虚拟能 rollout 能在多大程度上减少真实世界交互?
主要发现
- 在 OpenAI Gym Fetch 机器人基准测试中,I-HER 平均将样本复杂度相比最先进模型无监督方法降低了整整一个数量级。
- 该方法在四个 Fetch 任务(Reach、Push、PickAndPlace、Slide)中除一项外,均达到了最先进模型无监督算法的渐近性能水平。
- 消融实验表明,HER 与基于集合的虚拟能 rollout 生成机制对克服多样化机器人任务中基于模型强化学习的失败模式均至关重要。
- 基于模型差异的内在奖励显著提升了探索能力,尤其在 PickAndPlace 等任务中,若使用简单内在奖励可能误导智能体。
- 在数据收集阶段混合真实与虚拟能 rollout 显著增强了策略的泛化能力,确保虚拟能行为在真实环境中得到校正。
- 通过在每次模型更新后重新生成虚拟能数据,该方法表现出对模型不准确性的鲁棒性,防止策略因预测误差而过拟合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。