Skip to main content
QUICK REVIEW

[论文解读] Social Attention: Modeling Attention in Human Crowds

Anirudh Vemula, Katharina Muelling|arXiv (Cornell University)|Oct 12, 2017
Anomaly Detection Techniques and Applications被引用 8
一句话总结

本文提出 Social Attention,一种新颖的轨迹预测模型,通过在人群所有行人之间使用软注意力机制,捕捉非局部、上下文感知的人与人之间的交互,从而在两个真实世界数据集上,通过建模超越基于邻近性假设的动态长程依赖关系,提升了最先进方法的预测准确率。

ABSTRACT

Robots that navigate through human crowds need to be able to plan safe, efficient, and human predictable trajectories. This is a particularly challenging problem as it requires the robot to predict future human trajectories within a crowd where everyone implicitly cooperates with each other to avoid collisions. Previous approaches to human trajectory prediction have modeled the interactions between humans as a function of proximity. However, that is not necessarily true as some people in our immediate vicinity moving in the same direction might not be as important as other people that are further away, but that might collide with us in the future. In this work, we propose Social Attention, a novel trajectory prediction model that captures the relative importance of each person when navigating in the crowd, irrespective of their proximity. We demonstrate the performance of our method against a state-of-the-art approach on two publicly available crowd datasets and analyze the trained attention model to gain a better understanding of which surrounding agents humans attend to, when navigating in a crowd.

研究动机与目标

  • 解决基于邻近性的模型在捕捉人群导航中长程、非局部人与人交互方面的局限性。
  • 通过建模所有行人之间的相对影响(无论距离远近)来提升轨迹预测的准确性。
  • 开发一种完全可微分、联合训练的 RNN 混合模型,以捕捉人群运动中的空间与时间动态。
  • 通过预测反映真实人群观察到的注意力模式的人类轨迹,实现符合社交规范的机器人导航。
  • 分析学习到的注意力机制,理解人类在导航过程中关注哪些个体,从而为人群动态提供可解释性。

提出的方法

  • 提出一种前馈、完全可微分且联合训练的循环神经网络(RNN)混合模型,用于建模人群中所有个体的时间与空间动态。
  • 实现一种软注意力机制,计算每个个体与其他所有个体之间的注意力得分,使非局部交互能够影响预测结果。
  • 使用评分函数(公式 4)基于相对运动特征(如速度、朝向和碰撞时间)计算注意力权重,而不仅依赖距离。
  • 通过所有个体未来轨迹的联合损失端到端训练模型,实现在人群中的共享表征学习。
  • 在 GPU 上并行推理,尽管全局建模所有个体,仍保持实时性能(10Hz)。
  • 使用 RNN 混合模型来建模单个个体的轨迹,同时关注整个人群,从而实现动态、上下文敏感的预测。

实验结果

研究问题

  • RQ1与基于邻近性的模型相比,非局部注意力机制是否能在拥挤环境中提升轨迹预测的准确性?
  • RQ2人类在导航过程中隐式关注哪些周边个体?这些模式能否从数据中学习到?
  • RQ3Social Attention 中的注意力机制在动态人群场景中是否反映真实的人类注意力行为?
  • RQ4建模全局交互(超越局部邻域)在真实世界数据集上的预测性能提升程度如何?
  • RQ5注意力机制的失败模式是什么?它们与对远距离或静止个体的相对影响误判有何关联?

主要发现

  • Social Attention 在两个公开可用的人群数据集上优于最先进方法 Social LSTM,实现了更低的平均位移误差(ADE)和最终位移误差(FDE)。
  • 在 ETH 和 UCY 数据集上,与 Social LSTM 相比,FDE 相对提升了 10-15%,表明其具备更优的泛化能力与准确性。
  • 注意力机制成功识别出即使距离较远但处于动态移动状态的个体为更具影响力的个体,与观察到的人类导航行为一致。
  • 当远处的个体以相似方式移动且预计不会发生交互时,模型会赋予它们相等的关注度,反映出对潜在碰撞风险的理性评估。
  • 失败案例显示,模型偶尔会将高注意力分配给无影响的个体(如远距离或静止的行人),表明其在捕捉细微运动线索方面仍存在局限。
  • 定性分析证实,注意力机制能够学习优先关注具有高碰撞潜力的个体,如迎面而来或高速移动的个体,即使在远距离也能识别。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。