Skip to main content
QUICK REVIEW

[论文解读] Role Playing Learning for Socially Concomitant Mobile Robot Navigation

Mingming Li, Rui Jiang|arXiv (Cornell University)|May 29, 2017
Reinforcement Learning in Robotics参考文献 46被引用 3
一句话总结

本文提出角色扮演学习(RPL),一种强化学习框架,使移动机器人能够在动态环境中与人类同伴协同进行社会性导航。通过使用真实行人轨迹模拟交互,并利用PO-TRPO优化神经网络策略,机器人学习在保持与同伴接近的同时协同避障,实测中实现了1.05米的平均同伴距离和0.49米的最小行人距离,展现出类人导航行为。

ABSTRACT

In this paper, we present the Role Playing Learning (RPL) scheme for a mobile robot to navigate socially with its human companion in populated environments. Neural networks (NN) are constructed to parameterize a stochastic policy that directly maps sensory data collected by the robot to its velocity outputs, while respecting a set of social norms. An efficient simulative learning environment is built with maps and pedestrians trajectories collected from a number of real-world crowd data sets. In each learning iteration, a robot equipped with the NN policy is created virtually in the learning environment to play itself as a companied pedestrian and navigate towards a goal in a socially concomitant manner. Thus, we call this process Role Playing Learning, which is formulated under a reinforcement learning (RL) framework. The NN policy is optimized end-to-end using Trust Region Policy Optimization (TRPO), with consideration of the imperfectness of robot's sensor measurements. Simulative and experimental results are provided to demonstrate the efficacy and superiority of our method.

研究动机与目标

  • 解决社会协同导航(SCN)的挑战,即机器人需在避免与他人碰撞的同时与人类同伴协同导航。
  • 克服传统方法将行人视为静态障碍物或假设共享决策模型的局限性。
  • 开发一种可泛化的、对传感器具有鲁棒性的导航策略,无需全局地图、已知目标或领域特定特征。
  • 通过模拟真实行人轨迹的环境实现高效且安全的策略学习。
  • 确保机器人在与同伴保持自然舒适距离(平均1.05米)的同时,与其他行人保持安全距离(最小0.49米)。

提出的方法

  • 将SCN建模为部分可观察马尔可夫决策过程(POMDP),以考虑传感器噪声和观测不完整的问题。
  • 利用真实世界人群轨迹数据集构建模拟学习环境,以复现行人行为和走廊动态特性。
  • 使用部分可观察信任区域策略优化(PO-TRPO)训练神经网络策略,以处理观测不确定性并支持在线策略学习。
  • 实施角色扮演学习(RPL),在每次训练迭代中,机器人虚拟地“扮演”其同伴角色,模拟与随机选择的行人联合导航。
  • 通过基于与目标距离、碰撞避免和同伴距离指标的稀疏奖励,端到端优化策略。
  • 将传感器噪声和视场受限约束直接整合到观测空间中,以反映真实机器人性能限制。

实验结果

研究问题

  • RQ1机器人是否能在不了解同伴目标的前提下,学习在人群密集、动态的环境中与人类同伴协同导航?
  • RQ2机器人如何在避免与其他行人碰撞的同时,维持与同伴的社会可接受距离(平均1.05米)?
  • RQ3在使用真实行人轨迹的模拟环境中训练的策略,在未见过的真实世界场景中泛化程度如何?
  • RQ4机器人是否能在不假设共享决策模型的前提下,实现类人协同避障行为?
  • RQ5传感器噪声和部分可观测性在多大程度上影响社会协同导航策略的鲁棒性和性能?

主要发现

  • 在联合避障过程中,机器人与迎面而来的行人保持了最小平均距离0.49米,证明了其在障碍物导航中的安全性和有效性。
  • 平均同伴距离为1.05米,与人类控制基线的1.0米非常接近,表明机器人表现出强烈的陪伴行为和自然的步态同步。
  • 机器人通过主动让位(如靠近墙壁以允许他人通过)成功避免了“机器人冻结问题”。
  • 该策略在真实世界场景中表现出良好的泛化能力,在社会导航和SCN任务中性能与人类驾驶导航相当。
  • RPL框架实现了端到端训练,无需全局地图、已知目标或人工设计特征,显著提升了策略的泛化能力。
  • PO-TRPO在部分可观测条件下有效优化了策略,展现出对传感器噪声和视场受限约束的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。