Skip to main content
QUICK REVIEW

[论文解读] Memory Based Trajectory-conditioned Policies for Learning from Sparse Rewards

Yijie Guo, Jongwook Choi|arXiv (Cornell University)|Jul 24, 2019
Reinforcement Learning in Robotics被引用 14
一句话总结

本文提出 DTSIL,一种基于记忆的轨迹条件策略,通过模仿记忆缓冲区中多样化的历史轨迹,提升稀疏奖励强化学习中的探索能力。通过将策略学习条件化于多条示范轨迹,并采用带注意力机制的序列到序列建模,DTSIL 实现了灵活且具有探索性的行为,其性能优于基于计数的探索方法和自模仿学习,在 Montezuma’s Revenge 和 Pitfall 等困难的 Atari 游戏环境中实现了最先进性能,且无需专家示范或任意重置。

ABSTRACT

Reinforcement learning with sparse rewards is challenging because an agent can rarely obtain non-zero rewards and hence, gradient-based optimization of parameterized policies can be incremental and slow. Recent work demonstrated that using a memory buffer of previous successful trajectories can result in more effective policies. However, existing methods may overly exploit past successful experiences, which can encourage the agent to adopt sub-optimal and myopic behaviors. In this work, instead of focusing on good experiences with limited diversity, we propose to learn a trajectory-conditioned policy to follow and expand diverse past trajectories from a memory buffer. Our method allows the agent to reach diverse regions in the state space and improve upon the past trajectories to reach new states. We empirically show that our approach significantly outperforms count-based exploration methods (parametric approach) and self-imitation learning (parametric approach with non-parametric memory) on various complex tasks with local optima. In particular, without using expert demonstrations or resetting to arbitrary states, we achieve the state-of-the-art scores under five billion number of frames, on challenging Atari games such as Montezuma's Revenge and Pitfall.

研究动机与目标

  • 为解决稀疏奖励强化学习中的挑战,即梯度更新缓慢且智能体常陷入局部最优的问题。
  • 克服现有方法过度利用少数成功轨迹的局限,避免短视且次优的行为。
  • 通过利用存储在记忆缓冲区中的多样化过往经验,提升样本效率和长时程探索能力。
  • 通过编辑和增强存储的示范轨迹,生成新轨迹,使智能体能够发现新状态并获得更高奖励。
  • 在不使用专家示范或任意状态重置机制的前提下,实现在具有挑战性的 Atari 游戏上的最先进性能。

提出的方法

  • 该方法采用轨迹条件策略,将过去成功轨迹中的一系列状态作为输入上下文,用于生成动作。
  • 采用带注意力机制的序列到序列模型,学习将示范轨迹转换为新的动作序列,从而实现随机且灵活的策略行为。
  • 利用监督学习目标在记忆缓冲区中存储的多样化轨迹上训练策略,促进探索超出最常访问路径的行为。
  • 记忆缓冲区存储过去回合的完整轨迹,策略可基于任意此类轨迹进行条件化,以生成新的探索性行为。
  • 该方法结合基于轨迹级示范的计数探索与模仿学习,引导智能体朝向较少访问但潜在高回报的状态前进。
  • 探索了一种分层变体:高层策略基于缓冲区中的轨迹提出子目标,低层策略执行动作以实现这些目标,从而提升在未见环境中的泛化能力。

实验结果

研究问题

  • RQ1与标准的基于计数或自模仿方法相比,从记忆缓冲区中模仿多样化历史轨迹是否能提升稀疏奖励环境中的探索能力?
  • RQ2将策略条件化于多条多样化轨迹是否能减少短视行为,并有助于避免过早收敛至次优策略?
  • RQ3带注意力机制的序列到序列模型是否能有效通过编辑存储的示范轨迹,生成新的高回报轨迹?
  • RQ4该方法在无需专家示范或重置到状态机制的情况下,对未见环境的泛化能力如何?
  • RQ5在具有局部最优和长时程任务的环境中(如 Montezuma’s Revenge 和 Pitfall),该方法表现如何?

主要发现

  • 在五亿帧训练后,DTSIL 在 Montezuma’s Revenge 和 Pitfall 上实现了最先进性能,优于先前方法,且无需使用专家示范或任意重置。
  • 通过利用多样化轨迹,该方法显著提升了样本效率和探索能力,使智能体能够到达 Pitfall 的最左房间并收集大量钻石,而先前的 SOTA 方法未能实现此目标。
  • 在随机迷宫环境中,分层 DTSIL 变体可泛化至未见过的迷宫,在测试集上的平均回合奖励高于 PPO+EXP。
  • DTSIL 在多个具有局部最优和随机动力学的任务中,均优于基于计数的探索和自模仿学习。
  • 采用多样化轨迹条件化显著提升了长期回报,并避免了过早收敛至次优策略。
  • 实验结果表明,该方法在需要长时程推理和稀疏奖励的环境中具有鲁棒性和有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。