[论文解读] Crowd-Robot Interaction: Crowd-aware Robot Navigation with Attention-based Deep Reinforcement Learning
该论文提出了一种基于注意力机制的深度强化学习框架SARL,用于建模人群中的机器人-人类及人类-人类交互行为。通过使用自注意力机制,根据邻近人类的未来状态动态加权其重要性,该模型提升了对人群动态的预测能力,在仿真和真实世界实验中(基于Segway平台)均实现了比当前最先进方法更快、更安全的导航表现。
Mobility in an effective and socially-compliant manner is an essential yet challenging task for robots operating in crowded spaces. Recent works have shown the power of deep reinforcement learning techniques to learn socially cooperative policies. However, their cooperation ability deteriorates as the crowd grows since they typically relax the problem as a one-way Human-Robot interaction problem. In this work, we want to go beyond first-order Human-Robot interaction and more explicitly model Crowd-Robot Interaction (CRI). We propose to (i) rethink pairwise interactions with a self-attention mechanism, and (ii) jointly model Human-Robot as well as Human-Human interactions in the deep reinforcement learning framework. Our model captures the Human-Human interactions occurring in dense crowds that indirectly affects the robot's anticipation capability. Our proposed attentive pooling mechanism learns the collective importance of neighboring humans with respect to their future states. Various experiments demonstrate that our model can anticipate human dynamics and navigate in crowds with time efficiency, outperforming state-of-the-art methods.
研究动机与目标
- 解决现有机器人导航方法对人群交互建模过于简单或忽略人类-人类动态的问题。
- 通过联合建模机器人-人类与人类-人类交互,提升机器人在密集人群中的导航性能。
- 通过注意力机制学习邻近智能体的相对重要性,增强对人类运动的预测能力。
- 开发一种计算高效、端到端可微的策略,适用于多样化的人群场景。
提出的方法
- 该方法采用自注意力机制聚合机器人与每个人类之间的交互特征,基于其预测的未来状态学习每个人类的相对重要性。
- 利用局部地图编码人类-人类交互,捕捉影响机器人规划的集体人群行为。
- 将机器人-人类与人类-人类对的交互特征通过多头自注意力层处理,生成紧凑且上下文感知的人群表征。
- 通过模仿学习结合专家演示来预热策略,随后采用深度强化学习进一步优化导航行为。
- 一种变体LM-SARL将局部地图整合到注意力机制中,以更好地建模复杂的人类-人类交互。
- 最终策略通过端到端深度强化学习训练,以优化导航的时间效率与安全性。
实验结果
研究问题
- RQ1如何通过建模机器人-人类与人类-人类交互,使机器人在密集人群中有效预测人类运动?
- RQ2自注意力机制是否能通过为邻近人类动态分配重要性权重,改善人群动态的表征?
- RQ3联合建模机器人-人类与人类-人类交互是否相比单向交互模型能带来更高效、更安全的导航?
- RQ4将局部地图用于人类-人类交互建模,如何影响机器人对复杂人群行为的推理能力?
主要发现
- 所提出的SARL模型在多种仿真场景中,包括密集与复杂人群环境,均在导航时间与成功率方面优于当前最先进方法。
- LM-SARL通过在注意力机制中引入局部地图,在正确识别出人群中心的安全捷径方面表现更优,避免了激进或过度保守的行为。
- 注意力机制成功识别出最具影响力的个体(如即将接近机器人的个体),展示了模型对动态人群重要性的推理能力。
- 在价值估计方面,SARL与LM-SARL在危险方向(70°至200°)正确预测低值,从而实现安全减速;而基线方法在这些区域高估了价值。
- 在Segway机器人平台上的真实世界实验验证了该模型的鲁棒性与泛化能力,机器人成功利用学习到的策略穿越真实人群。
- 消融实验表明,若移除自注意力机制或局部地图集成,性能将显著下降,验证了两个组件的贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。