Skip to main content
QUICK REVIEW

[论文解读] Foresight Social-aware Reinforcement Learning for Robot Navigation

Yanying Zhou, Shijie Li|arXiv (Cornell University)|May 27, 2021
Evacuation and Crowd Dynamics参考文献 26被引用 4
一句话总结

本文提出 R-SARL,一种用于复杂拥挤环境中非完整机器人导航的深度强化学习框架。通过在奖励函数中引入对静态和动态障碍物的前瞻性不安全交互行为的惩罚,同时分别建模其影响,该方法减少了过度绕行和超时现象,在多种仿真场景中实现了安全、成功率和效率方面的最先进性能。

ABSTRACT

When robots handle navigation tasks while avoiding collisions, they perform in crowded and complex environments not as good as in stable and homogeneous environments. This often results in a low success rate and poor efficiency. Therefore, we propose a novel Foresight Social-aware Reinforcement Learning (FSRL) framework for mobile robots to achieve collision-free navigation. Compared to previous learning-based methods, our approach is foresighted. It not only considers the current human-robot interaction to avoid an immediate collision, but also estimates upcoming social interactions to still keep distance in the future. Furthermore, an efficiency constraint is introduced in our approach that significantly reduces navigation time. Comparative experiments are performed to verify the effectiveness and efficiency of our proposed method under more realistic and challenging simulated environments.

研究动机与目标

  • 解决现有社交感知导航方法在密集复杂人群环境中因过度谨慎回避或冻结行为而失效的局限性。
  • 提升非完整单轮机器人(在现实应用中常见但社交强化学习领域研究不足)的导航性能。
  • 通过主动惩罚与静态和动态障碍物的不安全前瞻性交互,缓解‘机器人冻结问题’。
  • 通过分别建模静态和动态障碍物对未来轨迹的影响,实现安全与效率的平衡。
  • 设计一种奖励函数,以促进在密集人群中的社会合理、高效且无碰撞的导航行为。

提出的方法

  • 提出 R-SARL,一种将前瞻性社交意识融入奖励函数的深度强化学习框架。
  • 引入一种新颖的惩罚机制,用于在规定距离内对不安全的前瞻性交互行为进行惩罚,提前预测未来碰撞。
  • 在奖励函数中分别建模与静态障碍物(如静止的人)和动态障碍物(如移动的人)的不安全交互影响。
  • 设计一种结合碰撞惩罚、超时惩罚和导航效率指标的奖励函数,以指导策略学习。
  • 使用深度 Q 网络(DQN)近似值函数,并在非完整约束下学习最优控制策略。
  • 在具有不同人群密度和障碍物配置的仿真环境中端到端训练策略,以实现对复杂场景的泛化能力。

实验结果

研究问题

  • RQ1如何训练深度强化学习智能体,使其在密集人群中避免静态和动态障碍物,同时防止冻结或过度绕行?
  • RQ2前瞻性意识奖励设计在复杂动态环境中在多大程度上提升了导航成功率并减少了超时?
  • RQ3分别建模静态和动态障碍物交互是否能带来更高效且符合社会规范的导航路径?
  • RQ4与最先进方法相比,所提出的 R-SARL 框架在安全性、成功率和导航效率方面表现如何?
  • RQ5在奖励函数中集成前瞻性交互估计是否能减少保守回避行为,同时不增加碰撞率?

主要发现

  • 在最复杂环境(Env. 3)中,R-SARL 的成功率比 SARL 高 10%,而在更简单场景中差距为 4%,表明其在密集人群中的鲁棒性显著提升。
  • 在 Env. 1 中,碰撞率从 0.12 降低至 0.09(减少 0.05),在 Env. 3 中从 0.15 降低至 0.12(减少 0.03),表明在不牺牲效率的前提下实现了更好的碰撞规避。
  • 在 Env. 1 中,超时率从 0.08 降低至 0.06(减少 0.02),在 Env. 3 中从 0.23 降低至 0.16(减少 0.07),表明在极端场景中具有更强的韧性。
  • 平均导航时间与 SARL 相当(Env. 1 中为 9.42 vs. 8.94),但 R-SARL 在处理更困难情况时仍能保持此水平,表明其避免了导致 SARL 有效超时时间增加的‘冻结’行为。
  • 与 SARL 相比,R-SARL 将近距离互动频率(低于不适距离)降低了 12.5%,表明其减少了过度绕行。
  • 消融实验表明,结合前瞻性交互惩罚和超时惩罚(即 R-SARL)的性能最佳,优于仅使用单一组件的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。