[论文解读] DenseTNT: Waymo Open Dataset Motion Prediction Challenge 1st Place Solution
DenseTNT 提出了一种无锚点的、密集的目标概率估计方法,用于自动驾驶中的多轨迹运动预测,通过基于注意力的特征编码来预测高清地图上的密集目标分布。该方法实现了最先进性能,在 Waymo Open Dataset 运动预测挑战赛中以 mAP 0.3281 的成绩位列第一。
In autonomous driving, goal-based multi-trajectory prediction methods are proved to be effective recently, where they first score goal candidates, then select a final set of goals, and finally complete trajectories based on the selected goals. However, these methods usually involve goal predictions based on sparse predefined anchors. In this work, we propose an anchor-free model, named DenseTNT, which performs dense goal probability estimation for trajectory prediction. Our model achieves state-of-the-art performance, and ranks 1st on the Waymo Open Dataset Motion Prediction Challenge. Project page is at https://github.com/Tsinghua-MARS-Lab/DenseTNT.
研究动机与目标
- 解决现有基于目标的轨迹预测方法中稀疏且基于启发式定义的目标锚点的局限性。
- 通过在道路表面和停车区域实现细粒度的密集目标估计,提升轨迹预测性能。
- 通过在所有可能的目标位置上建模连续概率分布,消除对预定义锚点质量的依赖。
- 通过移除一个锚点对应一个目标的约束,实现在单个位置周围的多轨迹预测。
- 通过端到端的密集目标估计与轨迹补全,实现在 Waymo Open Dataset 运动预测挑战赛中的卓越性能。
提出的方法
- 使用矢量化编码从高清地图和智能体中提取稀疏场景上下文特征,将车道和车辆表示为多段线。
- 实现一个密集目标编码模块,以 1 米的间隔在道路和停车区域采样目标,生成一组密集的候选目标位置。
- 应用注意力机制,计算每个目标与地图元素(车道、智能体)之间的局部上下文特征,使用带有可学习权重的查询/键/值投影。
- 通过可微的 Softmax 在学习得分上预测目标概率,其中每个目标的得分通过其二维坐标的两层多层感知机(MLP)计算得出。
- 使用二元交叉熵损失进行模型训练,将最接近的真实目标标记为 1,其余为 0。
- 应用非极大值抑制(NMS)选择 top-K 概率最高的目标,随后通过轨迹生成模块完成完整轨迹的生成。
实验结果
研究问题
- RQ1密集的、无锚点的目标概率估计是否能在多轨迹运动预测中优于稀疏的锚点方法?
- RQ2在每个目标周围建模细粒度的局部上下文是否相比稀疏锚点采样能提升预测准确性?
- RQ3基于注意力的密集编码机制是否能有效捕捉目标与地图元素之间的结构和空间关系?
- RQ4在 Argoverse 和 Waymo 等标准基准上,密集目标估计的性能与稀疏锚点方法相比如何?
- RQ5所提出的方法是否能跨不同类型的智能体(车辆、行人、骑行人)实现良好泛化,这些智能体具有不同的运动模式?
主要发现
- DenseTNT 在 Waymo Open Dataset 运动预测挑战赛中取得了最高的 mAP 0.3281,位列 10 个顶级参赛模型中的第一名。
- 在 Argoverse Forecasting 验证集上,密集模型将 minFDE 从稀疏基线的 1.35 降低至 1.28,Miss Rate 从 9.5% 降低至 8.2%。
- 模型在车辆上的 mAP 为 0.3698,行人 0.3342,骑行人 0.2802,表明其在不同智能体类型间具有强大的泛化能力。
- 定性结果表明,模型能生成包括直行、左转/右转和 U 型转弯在内的多样化预测,且密集目标概率有效捕捉了多模态行为。
- 消融实验证实,与基于稀疏锚点的方法相比,密集目标估计通过实现每个位置的多轨迹预测,显著提升了性能。
- 该模型优于强基线模型,如 TVN(第二名,mAP 0.3168)和 SceneTransformer(mAP 0.2788),在轨迹多样性与准确性方面展现出明显优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。