Skip to main content
QUICK REVIEW

[论文解读] Heterogeneous Edge-Enhanced Graph Attention Network For Multi-Agent Trajectory Prediction

Xiaoyu Mo, Yang Xing|arXiv (Cornell University)|Jun 14, 2021
Autonomous Vehicle Technology and Safety参考文献 35被引用 17
一句话总结

该论文提出了一种三通道框架,采用新颖的异构边缘增强图注意力网络(HEAT),用于在复杂的城市和高速公路场景中实现多智能体轨迹的联合预测。通过建模异构智能体动态、带有边缘特征的有向图来表示智能体间交互,以及使用门控地图选择器实现共享地图表征,HEAT在INTERACTION数据集上实现了最先进性能:1秒预测时RMSE为0.68米,5秒预测时RMSE为2.05米。

ABSTRACT

Simultaneous trajectory prediction for multiple heterogeneous traffic participants is essential for the safe and efficient operation of connected automated vehicles under complex driving situations in the real world. The multi-agent prediction task is challenging, as the motions of traffic participants are affected by many factors, including their individual dynamics, their interactions with surrounding agents, the traffic infrastructures, and the number and modalities of the target agents. To further advance the trajectory prediction techniques, in this work we propose a three-channel framework together with a novel Heterogeneous Edge-enhanced graph ATtention network (HEAT), which is able to deal with the heterogeneity of the target agents and traffic participants involved. Specifically, the agent's dynamics are extracted from their historical states using type-specific encoders. The inter-agent interactions are represented with a directed edge-featured heterogeneous graph, and then interaction features are extracted using the proposed HEAT network. Besides, the map features are shared across all agents by introducing a selective gate mechanism. And finally, the trajectories of multi-agent are executed simultaneously. Validations using both urban and highway driving datasets show that the proposed model can realize simultaneous trajectory predictions for multiple agents under complex traffic situations, and achieve state-of-the-art performance with respect to prediction accuracy, demonstrating its feasibility and effectiveness.

研究动机与目标

  • 解决在复杂驾驶环境中对多种异构交通参与者(车辆、行人、骑行者)进行联合轨迹预测的挑战。
  • 克服现有方法依赖共享坐标系的局限性,此类方法对平移和旋转敏感,限制了建模灵活性。
  • 通过使用带有类型和交互动态信息的有向、异构边缘图来表示智能体间交互,提升交互建模能力。
  • 通过门控机制实现跨智能体的选择性共享地图表征,提升效率和泛化能力,同时避免为每个智能体存储独立地图。
  • 在包括城市和高速公路环境在内的多样化场景中实现高精度预测,同时支持任意数量的智能体和不同模态。

提出的方法

  • 采用三通道框架:一通道用于智能体特定动态建模(使用各类型专用编码器在独立坐标系中),一通道用于交互建模(通过异构边缘特征图),一通道用于地图表征(结合门控选择器)。
  • 将智能体间交互表示为有向异构图,其中节点代表不同类型的智能体(如车辆、行人),边携带相对位置、速度和交互类型等属性。
  • 设计异构边缘增强图注意力网络(HEAT)以同时关注节点和边特征,实现跨异构智能体类型的类型感知消息传递。
  • 引入选择性门控机制,动态控制每个智能体接收的地图信息量,实现高效且自适应的跨智能体地图特征共享。
  • 使用通过CNN编码的共享俯视图地图,门控机制根据智能体特定的相关性调节地图输入,减少冗余并提升泛化能力。
  • 采用多任务损失函数端到端训练模型,联合优化轨迹预测与交互建模目标,实现动态、交互与地图特征的联合优化。

实验结果

研究问题

  • RQ1基于图的方法能否有效建模多智能体轨迹预测中多样化交通参与者(车辆、行人、骑行者)之间的异构交互?
  • RQ2与共享坐标系相比,为每个智能体使用独立坐标系在动态交通环境中如何提升预测鲁棒性?
  • RQ3在异构图中引入边特征(如相对运动、交互类型)相较于标准GAT,能在多大程度上提升交互建模能力?
  • RQ4基于门控的机制能否在不降低性能或增加计算成本的前提下,有效实现单张地图表征在多个智能体间的共享?
  • RQ5所提出的框架是否在多样化真实驾驶场景中均实现了短时和长时轨迹预测的最先进性能?

主要发现

  • 所提出的HEAT模型在INTERACTION数据集上1秒预测的RMSE为0.68米,优于先前方法如CS-LSTM(0.61米)和CNN-LSTM(0.64米)在相同设置下的表现。
  • 在5秒预测时延下,HEAT的RMSE为2.05米,显著优于基线GAT模型(如GAT-R-1的4.87米),并达到或超过MATF-GAN和Scale-Net等最先进方法的水平。
  • HEAT-R(采用共享地图与HEAT交互模块)在1秒时达到0.68米RMSE,5秒时达到2.05米RMSE,证明了其在不同智能体数量和类型下的鲁棒性与可扩展性。
  • 消融实验表明,HEAT-1(采用HEAT)在1秒时RMSE为0.6590米,显著优于GAT-1(0.7808米)和GAT-R-1(0.8228米),验证了所提交互建模方法的优越性。
  • 门控地图选择器实现了有效的地图共享,相比为每个智能体存储地图或简单全局共享,显著提升了泛化能力并降低了计算开销。
  • 可视化结果证实,HEAT能准确预测复杂场景中多个异构智能体的轨迹,包括变道、穿行和高密度交通等情形。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。