Skip to main content
QUICK REVIEW

[论文解读] Relational Graph Learning for Crowd Navigation

Changan Chen, Sha Hu|arXiv (Cornell University)|Sep 28, 2019
Anomaly Detection Techniques and Applications参考文献 45被引用 9
一句话总结

该论文提出了一种基于模型的深度强化学习的关联图学习方法,用于机器人在人群中的导航。通过图卷积网络(GCN)从潜在特征中学习关系,编码代理之间的高阶交互。该方法基于预测的人类运动实现多步前瞻规划,显著提升了导航效率,减少了碰撞,并消除了基线方法中存在的振荡和冻结行为。

ABSTRACT

We present a relational graph learning approach for robotic crowd navigation using model-based deep reinforcement learning that plans actions by looking into the future. Our approach reasons about the relations between all agents based on their latent features and uses a Graph Convolutional Network to encode higher-order interactions in each agent's state representation, which is subsequently leveraged for state prediction and value estimation. The ability to predict human motion allows us to perform multi-step lookahead planning, taking into account the temporal evolution of human crowds. We evaluate our approach against a state-of-the-art baseline for crowd navigation and ablations of our model to demonstrate that navigation with our approach is more efficient, results in fewer collisions, and avoids failure cases involving oscillatory and freezing behaviors.

研究动机与目标

  • 解决在具有复杂人类交互的动态人群环境中实现安全且高效的机器人导航的挑战。
  • 克服先前方法依赖启发式交互模型或假设人类运动为线性所带来的局限性。
  • 通过联合预测人类轨迹和估计状态值,利用关联推理实现长时程规划。
  • 缓解在拥挤环境中机器人振荡和冻结等故障模式。
  • 证明通过学习关系建模高阶交互可提升导航性能。

提出的方法

  • 该方法将机器人和人类代理表示为关联图中的节点,边表示基于潜在特征学习到的交互关系。
  • 图卷积网络(GCN)处理图结构,为机器人和人类计算具备交互感知的状态表示。
  • 通过学习的动力学模型预测未来人类轨迹,实现d步前瞻规划。
  • 利用包含预测未来状态和交互特征的价值网络估计状态值。
  • 策略基于多步规划的价值估计选择动作,实现非短视决策。
  • 该方法采用可微分框架,通过深度强化学习联合优化运动预测与导航策略。

实验结果

研究问题

  • RQ1通过GCN实现关联图学习是否能通过建模人类与机器人之间的高阶交互,提升多智能体导航性能?
  • RQ2基于预测人类运动的多步前瞻规划是否能减少碰撞并提升导航效率?
  • RQ3所提出的方法是否能缓解在复杂场景中常见的机器人振荡和冻结等故障情况?
  • RQ4规划深度(d)在成功率和避碰性能方面如何影响整体表现?
  • RQ5学习交互关系在群体导航中相比启发式或简化的交互模型,其性能优势在多大程度上体现?

主要发现

  • 当d=2时,所提方法的成功率达到0.572,显著优于基线的0.551,证明了长时程规划的优势。
  • 该模型减少了碰撞,并消除了基线方法在复杂场景中常见的振荡和冻结行为。
  • 两步前瞻规划通过预测未来交互(如两人相向而行)成功避免了碰撞。
  • 价值热力图可视化结果表明,当预测到未来交互时,模型会为高风险动作(如210°)分配较低价值,从而做出更安全的决策。
  • 该模型通过预测后续步骤中的补偿性正向奖励,解决了冻结问题,即使在即时动作带来不适惩罚时,也能实现非短视决策。
  • 在配备激光雷达和深度传感的Pioneer机器人上进行的真实世界部署,验证了该方法在真实环境中实时检测与跟踪人类的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。