[论文解读] JFP: Joint Future Prediction with Interactive Multi-Agent Modeling for Autonomous Driving
JFP 提出了一种端到端可训练的联合未来预测模型,通过在解码器中建模交互关系,使用动态成对图模型生成一致且不重叠的多智能体轨迹。该方法在 Waymo Open Motion Dataset 上达到最先进性能,并在公共和工业规模数据集的轨迹重叠指标上实现显著提升。
We propose JFP, a Joint Future Prediction model that can learn to generate accurate and consistent multi-agent future trajectories. For this task, many different methods have been proposed to capture social interactions in the encoding part of the model, however, considerably less focus has been placed on representing interactions in the decoder and output stages. As a result, the predicted trajectories are not necessarily consistent with each other, and often result in unrealistic trajectory overlaps. In contrast, we propose an end-to-end trainable model that learns directly the interaction between pairs of agents in a structured, graphical model formulation in order to generate consistent future trajectories. It sets new state-of-the-art results on Waymo Open Motion Dataset (WOMD) for the interactive setting. We also investigate a more complex multi-agent setting for both WOMD and a larger internal dataset, where our approach improves significantly on the trajectory overlap metrics while obtaining on-par or better performance on single-agent trajectory metrics.
研究动机与目标
- 为解决轨迹预测解码器中缺乏联合建模的问题,该问题常导致不一致且重叠的预测结果。
- 开发一种端到端可训练的模型,超越编码阶段,捕捉交互式多智能体动态,重点关注结构化输出表示。
- 在复杂拥挤场景中提升轨迹一致性,减少多智能体的不现实重叠。
- 通过基于自动驾驶车辆轨迹的条件分布建模,实现面向自动驾驶车辆的条件推理,以支持 AV 为中心的规划。
- 在大规模工业数据集上实现有效泛化,超越公共基准测试。
提出的方法
- 模型采用成对马尔可夫随机场(MRF)公式,其中节点代表智能体,边代表基于单个轨迹预测的动态成对交互关系。
- 从预测轨迹构建动态交互图,实现在无需真实图监督的情况下对智能体关系进行上下文感知建模。
- 在智能体对之间计算成对势能以编码轨迹一致性,利用消息传递机制优化联合预测。
- 通过优化所有智能体未来轨迹的联合对数似然,实现端到端训练。
- 基于能量的建模支持高效条件推理,这对自动驾驶规划至关重要,因为预测必须基于特定的自动驾驶车辆行为。
- 该方法支持全连接图和星型结构图,其中后者在以自动驾驶车辆为中心的自动驾驶场景中尤为有效。
实验结果
研究问题
- RQ1与边缘预测基线相比,解码器中采用结构化交互建模的联合未来预测是否能有效减少轨迹重叠?
- RQ2基于预测轨迹的动态图构建如何影响联合运动预测性能?
- RQ3该模型能否在保持联合指标(如重叠和条件预测)性能的同时,泛化到大规模工业数据集?
- RQ4在输出阶段建模成对交互是否能提升一致性,而无需显式依赖碰撞规避的领域知识?
- RQ5交互图拓扑结构的选择(如星型与全连接图)如何影响多智能体场景中的性能与可扩展性?
主要发现
- JFP 在 Waymo Open Motion Dataset 的交互运动预测赛道上达到最先进性能,优于 MultiPath++ 和 SceneTransformer。
- 在 WOMD 和更大规模的内部数据集上,JFP 显著降低了轨迹重叠指标——即使边缘指标和成对指标与基线持平或更优,仍实现显著改进。
- 基于动态图的变体在复杂场景(尤其涉及大量智能体时)优于固定图结构(如星型图和全连接图)。
- 以自动驾驶车辆为中心的星型图结构模型在 AV 条件预测指标上表现优异,证明其在以自动驾驶车辆为中心的规划任务中的适用性。
- 在 MRF 框架中通过消息传递实现的条件推理,能够准确生成基于特定自动驾驶车辆轨迹的联合预测,这是真实自动驾驶系统堆栈的关键需求。
- 定性结果表明,JFP 在复杂场景(如交叉路口、转弯操作和密集交通)中成功避免了轨迹重叠。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。