Skip to main content
QUICK REVIEW

[论文解读] Deep Reactive Planning in Dynamic Environments

Kei Ota, Devesh K. Jha|arXiv (Cornell University)|Oct 31, 2020
Reinforcement Learning in Robotics参考文献 32被引用 5
一句话总结

本文提出了一种端到端的深度强化学习框架,使机器人仅通过深度摄像头即可在动态环境中实现反应式规划。通过结合运动学规划、用于生成路径点的监督学习,以及基于路径条件的强化学习以实现轨迹跟踪,该方法在仿真和真实世界中的6-DoF机械臂任务中均实现了高样本效率和对新环境的泛化能力,对随机障碍物的成功率达到90%,对移动目标的成功率达到100%。

ABSTRACT

The main novelty of the proposed approach is that it allows a robot to learn an end-to-end policy which can adapt to changes in the environment during execution. While goal conditioning of policies has been studied in the RL literature, such approaches are not easily extended to cases where the robot's goal can change during execution. This is something that humans are naturally able to do. However, it is difficult for robots to learn such reflexes (i.e., to naturally respond to dynamic environments), especially when the goal location is not explicitly provided to the robot, and instead needs to be perceived through a vision sensor. In the current work, we present a method that can achieve such behavior by combining traditional kinematic planning, deep learning, and deep reinforcement learning in a synergistic fashion to generalize to arbitrary environments. We demonstrate the proposed approach for several reaching and pick-and-place tasks in simulation, as well as on a real system of a 6-DoF industrial manipulator. A video describing our work could be found \url{https://youtu.be/hE-Ew59GRPQ}.

研究动机与目标

  • 为了使机器人能够在执行过程中反应式地适应变化的目标,这是人类具备但难以在机器人系统中复现的能力。
  • 为了解决在任务执行过程中目标未显式提供但必须通过视觉感知来推断的挑战。
  • 开发一种样本高效、可泛化的策略,仅使用低成本深度传感器实现实时运行。
  • 通过在仿真中完全使用真实到仿真(real2sim)转换函数进行训练,缩小仿真到真实世界的差距,最大限度减少真实世界数据的采集。
  • 将轨迹规划与轨迹跟踪解耦,以实现模块化和可扩展的学习。

提出的方法

  • 使用离线RRT*规划器生成的轨迹,通过监督方式训练一个深度卷积神经网络(CNN),从深度图像中预测一系列路径点。
  • 通过路径条件化的深度强化学习(RL)策略学习跟踪任意给定的路径点序列,实现高效且稳定的轨迹跟踪。
  • 在仿真中使用真实到仿真(real2sim)转换函数训练RL策略,该函数将真实世界图像映射到仿真图像,从而实现高效且逼真的训练。
  • 系统采用两阶段架构:(1) 通过监督学习实现基于视觉的路径点预测;(2) 通过强化学习实现反应式轨迹跟踪,且在执行过程中动态更新目标状态。
  • 在强化学习训练中引入课程学习(curriculum learning),以提升收敛性和稳定性。
  • 整个策略在仿真中进行训练,并直接部署在真实世界的6-DoF工业机械臂上,无需微调。

实验结果

研究问题

  • RQ1机器人能否学习一种端到端的反应式策略,在无需显式目标指定的情况下适应动态变化的目标?
  • RQ2视觉机器人如何在不重新训练的情况下泛化到新环境和障碍物配置?
  • RQ3路径条件化的强化学习是否能提升复杂机器人操作任务中的样本效率和最终性能?
  • RQ4真实到仿真(real2sim)转换函数在仅使用极少真实世界数据的情况下,能在多大程度上实现有效的仿真到真实策略迁移?
  • RQ5将轨迹规划与轨迹跟踪解耦,是否能提升在动态环境中学习的稳定性和泛化能力?

主要发现

  • 所提出的方法在真实世界泛化任务(随机障碍物)中取得了90%的成功率,显著优于基线方法(0%成功率)。
  • 该方法在真实系统中对移动目标任务实现了100%的成功率,展示了在目标动态变化下具备鲁棒的反应式规划能力。
  • 路径条件化的RL智能体相比未使用路径点的基线RL智能体,收敛速度更快,最终性能更优,显著提升了样本效率。
  • 基于RL的低层控制器相比PID基线,平均角加速度降低了高达80%,实现了更平滑、更稳定的运动。
  • 与PID基线相比,该方法将到达目标的时间减少了50%以上,六种场景下的执行时间从0.89–1.26秒降至0.48–0.57秒。
  • 该系统在仿真和真实世界部署中均有效泛化到未见过的环境,且在仿真到真实迁移后无需任何微调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。