[论文解读] Multi-modal Trajectory Prediction for Autonomous Driving with Semantic Map and Dynamic Graph Attention Network
本文提出一种动态图注意力网络(DGAN),通过融合语义高清地图与多智能体交互,实现对各类交通参与者(车辆、骑行者、行人)在真实驾驶场景中的多模态、概率性轨迹预测。通过建模动态注意力区域并利用图注意力机制,该方法在物流、Stanford Drone 和 ETH/UCY 数据集上均超越当前最先进方法,在 ADE 与 FDE 指标上取得最先进性能,同时确保交通规则合规性。
Predicting future trajectories of surrounding obstacles is a crucial task for autonomous driving cars to achieve a high degree of road safety. There are several challenges in trajectory prediction in real-world traffic scenarios, including obeying traffic rules, dealing with social interactions, handling traffic of multi-class movement, and predicting multi-modal trajectories with probability. Inspired by people's natural habit of navigating traffic with attention to their goals and surroundings, this paper presents a unique dynamic graph attention network to solve all those challenges. The network is designed to model the dynamic social interactions among agents and conform to traffic rules with a semantic map. By extending the anchor-based method to multiple types of agents, the proposed method can predict multi-modal trajectories with probabilities for multi-class movements using a single model. We validate our approach on the proprietary autonomous driving dataset for the logistic delivery scenario and two publicly available datasets. The results show that our method outperforms state-of-the-art techniques and demonstrates the potential for trajectory prediction in real-world traffic.
研究动机与目标
- 为解决在复杂城市环境中对异构交通参与者(车辆、骑行者、行人)进行多模态、概率性轨迹预测的挑战。
- 通过将高精(HD)语义地图集成到轨迹预测中,实现交通规则合规性。
- 利用可学习注意力机制,对智能体之间动态且异质的社会交互进行建模。
- 在单一深度学习框架中统一建模多类别运动预测(车辆、骑行者、行人)。
- 通过联合编码观测轨迹、智能体状态与地图级上下文,提升预测准确率与鲁棒性。
提出的方法
- 该方法采用动态图注意力网络(DGAN),在每个时间步基于学习到的注意力区域构建动态图,模拟人类对相关智能体的关注。
- 通过图注意力网络(GAT)更新智能体嵌入,利用可学习注意力权重聚合邻近智能体的特征。
- 模型融合三种输入:智能体的观测轨迹、当前智能体状态(位置、朝向、尺寸),以及通过基于CNN的地图编码器编码的语义高清地图。
- 多头注意力机制计算智能体之间的注意力分数,使模型能够动态聚焦于相关社会交互。
- 预测头采用基于锚点的方法,生成多个轨迹候选,每个候选关联一个概率,以输出多模态结果。
- 损失函数结合预测轨迹的L2损失与预测概率的交叉熵损失,以同时优化准确率与置信度。
实验结果
研究问题
- RQ1统一的深度学习模型能否在尊重交通规则的前提下,有效预测异构交通参与者(车辆、骑行者、行人)的多模态、概率性轨迹?
- RQ2在交叉路口和复杂道路布局中,集成语义高清地图在多大程度上提升轨迹预测性能?
- RQ3建模动态注意力区域在多大程度上增强了模型捕捉智能体间动态社会交互的能力?
- RQ4在多种真实世界数据集上,所提出的DGAN方法在ADE与FDE指标上与最先进模型相比表现如何?
- RQ5地图上下文与动态图注意力的结合是否带来更合理且符合交通规则的轨迹预测?
主要发现
- 在自有的物流数据集上,所提出的DGAN方法在所有对比方法中达到最低的ADE与FDE,表明其在复杂配送场景中具备优越泛化能力。
- 在Stanford Drone数据集上,DGAN实现ADE为24.53、FDE为50.78,优于SOTA方法如Multipath(28.32/58.38)与CAR-Net(25.72/51.80)。
- 在ETH与UCY数据集上,DGAN实现平均ADE为0.57、FDE为1.18,优于S-LSTM、S-GAN等SOTA方法。
- 消融实验表明,使用语义地图显著提升了车辆与骑行者的性能,但对行人影响较小,因其地图级信号有限。
- 当K=8个锚点时模型性能最佳,进一步增加K值则收益递减,表明在多样性与准确性之间达到最优平衡。
- 可视化结果证实,最高概率预测轨迹与车道中心线对齐,表明地图引导规划效果显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。