Skip to main content
QUICK REVIEW

[论文解读] Multi-agent Trajectory Prediction with Fuzzy Query Attention

Nitin Kamra, Hao Zhu|arXiv (Cornell University)|Oct 29, 2020
Autonomous Vehicle Technology and Safety参考文献 32被引用 19
一句话总结

该论文提出了一种新型注意力机制——模糊查询注意力(Fuzzy Query Attention, FQA),通过学习连续值(模糊)的交互决策来建模多智能体轨迹预测,捕捉惯性、相对运动和意图等运动归纳偏置。FQA 通过关系图架构联合学习交互决策及其动态响应,在多种领域(包括人群、高速公路交通、物理模拟和NBA球员轨迹)实现了最先进性能。

ABSTRACT

Trajectory prediction for scenes with multiple agents and entities is a challenging problem in numerous domains such as traffic prediction, pedestrian tracking and path planning. We present a general architecture to address this challenge which models the crucial inductive biases of motion, namely, inertia, relative motion, intents and interactions. Specifically, we propose a relational model to flexibly model interactions between agents in diverse environments. Since it is well-known that human decision making is fuzzy by nature, at the core of our model lies a novel attention mechanism which models interactions by making continuous-valued (fuzzy) decisions and learning the corresponding responses. Our architecture demonstrates significant performance gains over existing state-of-the-art predictive models in diverse domains such as human crowd trajectories, US freeway traffic, NBA sports data and physics datasets. We also present ablations and augmentations to understand the decision-making process and the source of gains in our model.

研究动机与目标

  • 为解决在多智能体轨迹预测中建模复杂、连续值交互的挑战,这些交互本质上是模糊而非二值的。
  • 开发一种可泛化的架构,以捕捉运动的关键归纳偏置:惯性、相对运动、意图和交互。
  • 通过一种新型注意力机制建模交互,学习模糊决策及其动态响应,从而在多样化领域中提升预测性能。
  • 通过手动插入模糊决策(如“智能体A正在减速”)实现人机协同增强,以提升模型性能与可解释性。

提出的方法

  • FQA 采用基于图的架构,其中智能体为节点,交互通过学习的注意力机制建模。
  • 核心机制利用查询向量和键向量计算连续值(模糊)注意力分数,表示智能体对之间交互的程度。
  • 这些模糊决策用于计算加权消息传递,学习每个智能体如何受到其他影响智能体的作用。
  • 模型采用关系式消息传递框架,根据模糊交互强度动态更新智能体表示。
  • 支持人机协同增强,允许插入已知的模糊决策(例如“智能体A正在减速”)以引导学习过程。
  • 该架构通过轨迹数据端到端训练,损失函数针对多个数据集的预测准确性进行优化。

实验结果

研究问题

  • RQ1与二值或离散交互建模相比,连续值(模糊)决策是否能提升多智能体轨迹预测性能?
  • RQ2模糊注意力机制在交通、人群和物理等多样化现实场景中,能否有效捕捉复杂交互?
  • RQ3在缺乏其他特征的情况下,模糊决策本身在多大程度上能预测轨迹数据中的交互模式?
  • RQ4人类提供的模糊决策能否被有效集成到模型中以提升性能?
  • RQ5在具有不同交互动态的多样化数据集上,FQA 与最先进模型相比表现如何?

主要发现

  • FQA 在人类人群轨迹、美国高速公路交通(NGSIM)、牛顿物理模拟、静电粒子运动以及NBA球员追踪数据上,显著优于最先进模型。
  • 仅依靠模糊决策(无需其他输入特征)即可高度预测交互模式,证明其内在的表征能力。
  • 在 NGSIM 高速公路数据集上,通过引入人类知识作为模糊决策,RMSE 降低,表明对边界和子场景交互效应的建模得到改善。
  • FQA 准确建模了罕见但关键的事件,如智能体间碰撞和边界交互,而基线模型常会遗漏或错误表示这些情况。
  • 在库仑力作用下的带电粒子等混沌系统中,FQA 生成的轨迹更清晰、更逼真,且在捕捉高加速度动态方面优于基线模型。
  • 尽管性能优异,FQA 在 NBA 数据集上仍面临挑战,主要因高意图依赖性和长期不可预测性,提示需结合互补的意图建模方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。