[论文解读] Perceive, Interact, Predict: Learning Dynamic and Static Clues for End-to-End Motion Prediction
本文提出 PIP,一种基于 Transformer 的端到端框架,仅通过视频输入即可联合完成在线地图构建、目标检测与运动预测,无需依赖人工标注的高清地图或历史轨迹追踪。通过采用可微分的多任务交互机制,结合地图、智能体与模式查询,PIP 实现了 0.258 EPA 的最先进性能,优于基于追踪与基于高清地图的方法。
Motion prediction is highly relevant to the perception of dynamic objects and static map elements in the scenarios of autonomous driving. In this work, we propose PIP, the first end-to-end Transformer-based framework which jointly and interactively performs online mapping, object detection and motion prediction. PIP leverages map queries, agent queries and mode queries to encode the instance-wise information of map elements, agents and motion intentions, respectively. Based on the unified query representation, a differentiable multi-task interaction scheme is proposed to exploit the correlation between perception and prediction. Even without human-annotated HD map or agent's historical tracking trajectory as guidance information, PIP realizes end-to-end multi-agent motion prediction and achieves better performance than tracking-based and HD-map-based methods. PIP provides comprehensive high-level information of the driving scene (vectorized static map and dynamic objects with motion information), and contributes to the downstream planning and control. Code and models will be released for facilitating further research.
研究动机与目标
- 解决依赖高清地图的运动预测方法以及基于追踪的方法所面临的局限性,这些方法依赖于成本高昂、静态或过时的地图数据。
- 实现仅从视频输入端到端学习运动预测,无需人工标注的高清地图或历史智能体轨迹。
- 通过统一的基于查询的框架,联合优化感知与预测,建模动态智能体、静态地图元素与运动意图之间的交互关系。
- 开发一种完全可微分的多任务交互机制,利用感知与预测之间的相关性以提升预测准确性。
提出的方法
- PIP 使用三种查询类型——地图查询、智能体查询与模式查询,分别编码静态地图元素、动态智能体与运动意图的实例级表征。
- 运动交互模块通过注意力机制,实现智能体中心表征与地图特征之间的显式与隐式交互,融合地图上下文与智能体状态。
- 通过从本体中心坐标系切换至智能体中心坐标系,实现基于智能体的归一化,以降低预测方差。
- 基于置信度分数与空间接近度对地图特征进行过滤,确保在预测中使用相关地图上下文。
- 采用多任务损失联合训练模型,损失函数结合检测、地图构建与运动预测目标,损失权重可学习。
- 使用 VectorNet 进一步将地图特征编码为实例级表征,以增强运动与地图之间的交互。
实验结果
研究问题
- RQ1能否通过端到端框架,仅从原始视频中联合学习在线地图构建、目标检测与运动预测,而无需依赖预先构建的高清地图?
- RQ2如何在统一的基于查询的 Transformer 架构中,通过可微分的多任务交互机制有效关联感知与预测?
- RQ3仅使用视频输入,能否实现与使用高清地图或历史追踪数据的方法相当甚至更优的运动预测性能?
- RQ4显式与隐式的地图-智能体交互对轨迹预测的准确性与多样性有何影响?
主要发现
- PIP 实现了 0.258 EPA,超越了先前最先进方法 [11],证明了在无需高清地图或追踪的情况下仍具备卓越的运动预测性能。
- 与先前最先进方法相比,PIP 将 minADE 降低 0.91m,minFDE 降低 1.17m,表明轨迹预测精度显著提升。
- 使用预测的矢量化地图时,模型性能几乎与使用真实高清地图相当,minADE 仅相差 0.01m,表明对地图预测误差具有强鲁棒性。
- 消融实验证实了多任务交互设计的有效性,尤其是基于智能体的归一化与基于置信度的地图过滤机制。
- 定性结果表明,PIP 学习到了有意义的智能体-地图关联关系,并能生成多样且合理的多模态预测,尤其在变道车辆场景中表现突出。
- 该框架输出全面的高层场景表征——包括矢量化地图与具备运动感知能力的目标检测结果——为下游规划与控制提供支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。