Skip to main content
QUICK REVIEW

[论文解读] Learning World Transition Model for Socially Aware Robot Navigation

Yuxiang Cui, Haodong Zhang|arXiv (Cornell University)|Nov 8, 2020
Evacuation and Crowd Dynamics参考文献 21被引用 5
一句话总结

该论文提出了一种基于模型的强化学习框架,用于社会感知机器人导航,采用深度世界转移模型,从2D激光扫描中预测未来的观测结果和奖励。通过解耦自身运动以生成堆叠的局部障碍物地图,该方法提升了样本效率——仅需极少的真实交互数据即可完成训练,并在仿真和真实世界场景中均实现了高成功率,优于模仿学习和无模型强化学习基线方法。

ABSTRACT

Moving in dynamic pedestrian environments is one of the important requirements for autonomous mobile robots. We present a model-based reinforcement learning approach for robots to navigate through crowded environments. The navigation policy is trained with both real interaction data from multi-agent simulation and virtual data from a deep transition model that predicts the evolution of surrounding dynamics of mobile robots. The model takes laser scan sequence and robot's own state as input and outputs steering control. The laser sequence is further transformed into stacked local obstacle maps disentangled from robot's ego motion to separate the static and dynamic obstacles, simplifying the model training. We observe that our method can be trained with significantly less real interaction data in simulator but achieve similar level of success rate in social navigation task compared with other methods. Experiments were conducted in multiple social scenarios both in simulation and on real robots, the learned policy can guide the robots to the final targets successfully while avoiding pedestrians in a socially compliant manner. Code is available at https://github.com/YuxiangCui/model-based-social-navigation

研究动机与目标

  • 解决在训练社会感知机器人导航策略过程中样本效率低下的挑战。
  • 通过建模动态演变的周围环境,提升在动态行人环境中的泛化能力和安全性。
  • 通过生成合成数据,减少对大量真实世界交互数据的依赖。
  • 通过自监督世界模型,实现策略直接迁移到真实机器人。
  • 通过解耦的局部障碍物地图,区分静态与动态障碍物,提升决策能力。

提出的方法

  • 以自监督方式训练一个深度世界转移模型,从当前激光扫描和机器人状态中预测未来的激光观测结果及相应奖励。
  • 通过解耦自身运动,将激光扫描序列转换为堆叠的局部障碍物地图,分离静态与动态障碍物。
  • 利用真实交互数据与世界模型生成的丰富虚拟数据相结合的方式训练策略网络,提升样本效率。
  • 采用去中心化、策略共享的多智能体仿真环境进行策略训练,以实现逼真的社交互动动态。
  • 障碍物地图表示能够更清晰地区分静态与动态障碍物,简化策略学习过程。
  • 该框架采用基于模型的强化学习,其中世界模型用于模拟交互过程,加速策略优化。

实验结果

研究问题

  • RQ1自监督世界转移模型是否能显著提升训练社会感知导航策略的样本效率?
  • RQ2在激光扫描中解耦自身运动对策略性能和训练稳定性有何影响?
  • RQ3基于模型的方法是否能在更少的真实世界交互数据下,实现与无模型或模仿学习基线相当或更优的性能?
  • RQ4在仿真中训练的策略在多大程度上可成功迁移到真实世界机器人部署?
  • RQ5使用学习到的世界模型生成的虚拟数据,对收敛速度和最终性能有何影响?

主要发现

  • 与FDMCA和MNDS相比,该方法即使使用显著更少的真实交互数据,仍实现了更高的平均奖励和更快的收敛速度。
  • 基于模型的方法结合虚拟数据生成,减少了对大量真实世界交互数据的依赖,实现了高效的策略训练。
  • 在仿真中,该方法在通过和朝向场景中的成功率分别达到92%和90%,优于基线方法。
  • 在真实机器人上,该策略成功完成了通过、穿越和朝向场景的导航,同时保持了与行人间安全且符合社会规范的距离。
  • 在真实世界评估中,自护得分(安全距离合规性)达到94.3%,社交得分(舒适距离合规性)达到89.1%。
  • 消融实验表明,预测性世界模型和障碍物地图表示对性能至关重要,移除它们会导致收敛速度变慢和成功率降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。