Skip to main content
QUICK REVIEW

[论文解读] Integrating Behavior Cloning and Reinforcement Learning for Improved Performance in Dense and Sparse Reward Environments

Vinicius G. Goecks, Gregory M. Gremillion|arXiv (Cornell University)|Oct 9, 2019
Reinforcement Learning in Robotics参考文献 35被引用 9
一句话总结

本文提出Cycle-of-Learning(CoL)框架,一种结合行为克隆(BC)与1步Q-learning的演员-评论家强化学习方法,通过联合损失函数及在人类示范数据上的离策略预训练实现。该方法在密集奖励与稀疏奖励环境中均实现了稳定且高性能的策略学习,相较于最先进方法在训练速度、稳定性和最终性能方面表现更优,且预训练后无性能退化。

ABSTRACT

This paper investigates how to efficiently transition and update policies, trained initially with demonstrations, using off-policy actor-critic reinforcement learning. It is well-known that techniques based on Learning from Demonstrations, for example behavior cloning, can lead to proficient policies given limited data. However, it is currently unclear how to efficiently update that policy using reinforcement learning as these approaches are inherently optimizing different objective functions. Previous works have used loss functions, which combine behavior cloning losses with reinforcement learning losses to enable this update. However, the components of these loss functions are often set anecdotally, and their individual contributions are not well understood. In this work, we propose the Cycle-of-Learning (CoL) framework that uses an actor-critic architecture with a loss function that combines behavior cloning and 1-step Q-learning losses with an off-policy pre-training step from human demonstrations. This enables transition from behavior cloning to reinforcement learning without performance degradation and improves reinforcement learning in terms of overall performance and training time. Additionally, we carefully study the composition of these combined losses and their impact on overall policy learning. We show that our approach outperforms state-of-the-art techniques for combining behavior cloning and reinforcement learning for both dense and sparse reward scenarios. Our results also suggest that directly including the behavior cloning loss on demonstration data helps to ensure stable learning and ground future policy updates.

研究动机与目标

  • 为解决强化学习(RL)中样本效率低下与收敛缓慢的问题,特别是在探索成本高且不安全的稀疏奖励环境中。
  • 通过高效地从行为克隆(BC)过渡到深度强化学习(RL),实现无性能退化的策略学习。
  • 理解结合BC与RL损失组件对策略稳定性与性能的影响。
  • 开发一种方法,利用有限的人类示范实现初始策略的高性能,并通过离策略RL进行微调。
  • 在真实机器人系统中,仅通过最少的人机交互,实现安全、快速且稳定的策略改进。

提出的方法

  • CoL框架采用演员-评论家架构,其联合损失函数同时整合了在专家示范上的行为克隆损失与由智能体生成经验的1步Q-learning损失。
  • 采用离策略经验回放机制,保持专家(示范)与智能体生成轨迹的固定比例,以稳定学习并防止策略崩溃。
  • 该方法首先在人类示范数据上进行预训练,随后在RL微调阶段联合优化联合损失函数。
  • 还评估了一种优先经验回放(PER)变体,其中专家与智能体样本根据时序差分(TD)误差进行优先排序,以提升数据效率。
  • 框架采用端到端训练,使用类似深度确定性策略梯度(DDPG)的算法,演员与评论家共享同一神经网络。
  • 损失函数设计旨在保持对专家行为的忠实性,同时允许智能体探索并优化长期回报。

实验结果

研究问题

  • RQ1如何有效结合行为克隆与强化学习,以提升密集与稀疏奖励环境中样本效率与训练稳定性?
  • RQ2经验回放缓冲中专家与智能体经验的相对比例对策略性能与学习稳定性有何影响?
  • RQ3在行为克隆预训练后,联合优化BC与RL损失是否优于顺序或孤立应用各自方法?
  • RQ4与可变或不平衡比例相比,经验回放中采用专家与智能体样本的固定比例如何影响策略收敛与性能?
  • RQ5所提出方法是否能在高风险、高随机性的环境(如自主四旋翼降落)中实现稳定且高性能的策略学习?

主要发现

  • CoL框架在LunarLanderContinuous-v2与AirSim四旋翼环境的密集与稀疏奖励设置下,均优于最先进方法,包括行为克隆(BC)、DDPG与DAPG。
  • 在LunarLanderContinuous-v2的稀疏奖励版本中,BC与DDPG在五百万训练步后均未收敛,而CoL实现了稳定且高性能的策略。
  • DAPG收敛速度慢于CoL,且在预训练后起点性能较低;而CoL在无性能退化的前提下维持并提升了初始BC策略的性能。
  • 消融实验表明,经验回放缓冲中专家与智能体样本的固定比例对性能至关重要;仅顺序执行BC与RL而无联合优化无法获得同等收益。
  • 使用基于TD误差的优先经验回放(PER)进一步提升了学习效率,尤其在AirSim等高随机性环境中表现更优。
  • 联合损失函数整合了BC与1步Q-learning,确保了学习的稳定性与基于专家行为的策略更新,有效防止灾难性遗忘与性能崩溃。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。