Skip to main content
QUICK REVIEW

[论文解读] Residual Reinforcement Learning from Demonstrations

Minttu Alakuijala, Gabriel Dulac-Arnold|arXiv (Cornell University)|Jun 15, 2021
Robot Manipulation and Learning参考文献 27被引用 11
一句话总结

本文提出残差强化学习行为模仿(RRLfD),一种数据高效的方法,通过将行为克隆与残差强化学习相结合,从图像、本体感觉和稀疏奖励中学习视觉控制策略。通过用从示范中训练出的策略替代人工设计的基线控制器,RRLfD在高维机器人操作任务中实现了更优的泛化能力和样本效率,解决了标准强化学习从零开始训练无法达成的任务。

ABSTRACT

Residual reinforcement learning (RL) has been proposed as a way to solve challenging robotic tasks by adapting control actions from a conventional feedback controller to maximize a reward signal. We extend the residual formulation to learn from visual inputs and sparse rewards using demonstrations. Learning from images, proprioceptive inputs and a sparse task-completion reward relaxes the requirement of accessing full state features, such as object and target positions. In addition, replacing the base controller with a policy learned from demonstrations removes the dependency on a hand-engineered controller in favour of a dataset of demonstrations, which can be provided by non-experts. Our experimental evaluation on simulated manipulation tasks on a 6-DoF UR5 arm and a 28-DoF dexterous hand demonstrates that residual RL from demonstrations is able to generalize to unseen environment conditions more flexibly than either behavioral cloning or RL fine-tuning, and is capable of solving high-dimensional, sparse-reward tasks out of reach for RL from scratch.

研究动机与目标

  • 解决在具有稀疏奖励和视觉输入的高维控制任务中强化学习样本效率低下的挑战。
  • 通过用从示范中学习的策略替代人工设计的基线控制器,消除对人工设计控制器的依赖。
  • 通过在图像空间中结合行为克隆与残差强化学习,提升机器人操作中的泛化能力和样本效率。
  • 在无需完整状态估计或密集奖励塑形的情况下,实现从原始视觉和本体感觉输入中进行学习。
  • 证明基于示范的基线策略的残差强化学习在未见过的环境条件下,其泛化能力优于行为克隆或强化学习微调。

提出的方法

  • 通过在示范轨迹的图像和本体感觉观测上进行行为克隆训练基线策略,端到端学习任务相关的视觉特征。
  • 使用作用于基线策略输出的残差策略,通过稀疏奖励的强化学习学习其动作校正。
  • 在行为克隆策略与残差强化学习策略之间共享视觉特征编码器,以实现特征迁移与数据效率。
  • 应用标准深度强化学习算法(如SAC、DMPO)在稀疏奖励上训练残差策略,且在残差训练期间固定基线策略。
  • 采用残差控制形式,最终动作为基线策略动作与残差策略校正动作之和。
  • 不仅利用示范数据进行模仿,还用于预训练视觉表征,从而减少强化学习中的探索需求。

实验结果

研究问题

  • RQ1基于示范训练的残差强化学习策略是否在未见过的环境条件下比行为克隆或强化学习微调具有更好的泛化能力?
  • RQ2用行为克隆策略替代人工设计的基线控制器,是否能提升基于图像和稀疏奖励的机器人控制任务中的样本效率?
  • RQ3通过示范数据在行为克隆中学习到的视觉特征能否有效共享给残差强化学习策略以加速学习?
  • RQ4残差强化学习从示范中学习在多大程度上能解决强化学习从零开始训练无法实现的高维、稀疏奖励操作任务?
  • RQ5与直接对行为克隆策略进行强化学习微调相比,残差形式是否有助于缓解灾难性遗忘?

主要发现

  • RRLfD 成功解决了高维、稀疏奖励操作任务(如6-DoF UR5机械臂上的Pick、Bowl和Push任务,以及28-DoF灵巧手任务),而标准强化学习从零开始训练在训练预算内无法完成这些任务。
  • 该方法在未见过的环境条件下的泛化能力优于行为克隆或强化学习微调,表现出更强的鲁棒性。
  • 仅从图像中学习而无示范或密集奖励,无法获得成功策略,凸显了示范数据在实现样本效率中的必要性。
  • 使用完整状态输入相比仅使用图像可提升部分任务(如Push、Pen)的成功率,但RRLfD仅依赖视觉和本体感觉输入也实现了优异性能。
  • 与从零开始训练强化学习相比,残差形式显著降低了样本复杂度,使稀疏奖励的长时序任务得以学习。
  • 该方法在稀疏和密集奖励设置下均优于基线模型,当在密集奖励中加入稀疏任务完成奖励时,成功率进一步提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。