[论文解读] $AIR^2$ for Interaction Prediction
本文提出 $AIR^{2}$,一种新颖的交互预测模型,通过在双智能体轨迹锚点的笛卡尔积上建模联合置信度,增强了锚定运动预测框架。通过以双智能体为中心对场景进行栅格化,并使用CNN预测交互感知置信度,$AIR^{2}$ 在Waymo交互预测挑战赛排行榜上取得了最高的mAP(0.0963),显著优于基线模型。
The 2021 Waymo Interaction Prediction Challenge introduced a problem of predicting the future trajectories and confidences of two interacting agents jointly. We developed a solution that takes an anchored marginal motion prediction model with rasterization and augments it to model agent interaction. We do this by predicting the joint confidences using a rasterized image that highlights the ego agent and the interacting agent. Our solution operates on the cartesian product space of the anchors; hence the $"^2"$ in $AIR^2$. Our model achieved the highest mAP (the primary metric) on the leaderboard.
研究动机与目标
- 解决在自动驾驶场景中联合预测两个交互智能体未来轨迹与置信度的挑战。
- 通过显式建模智能体间依赖关系,克服独立运动预测的局限性。
- 通过将交互感知置信度估计整合到锚定、栅格化的运动预测框架中,提升预测准确性。
- 通过类型特定采样和专家子网络,缓解车辆、行人和自行车类别之间的数据不平衡问题。
- 通过度量损失敏感性分析优化损失权重,以最大化mAP性能。
提出的方法
- 在锚定运动预测模型 $AIR$ 的基础上,引入一个作用于两个智能体轨迹锚点笛卡尔积空间的联合置信度预测器。
- 将每个智能体为中心的场景图像进行栅格化,突出显示自身智能体和交互智能体,以编码空间与交互上下文信息,供CNN主干网络使用。
- 在栅格化图像上使用共享的CNN主干网络(EfficientNetB3)提取嵌入表示,随后通过按类别设计的专家头进行每类对象的预测。
- 每个智能体预测8个控制点,通过卡迪纳尔立方B样条插值生成完整的80步轨迹,以保证轨迹平滑性。
- 应用度量损失敏感性分析,调整损失权重($w_{cls}=60$,$w_{reg}=1$),以实现最优mAP性能。
- 通过集成四个具有不同随机初始化和训练快照的模型,提升模型鲁棒性与泛化能力。
实验结果
研究问题
- RQ1在轨迹锚点的笛卡尔积上进行联合置信度预测,是否能超越独立运动建模,提升交互预测性能?
- RQ2栅格化、以智能体为中心的场景编码在捕捉智能体间依赖关系以用于轨迹预测方面有多有效?
- RQ3通过按对象类型门控的专家子网络,在多类别数据不平衡背景下,能在多大程度上缓解性能下降问题?
- RQ4度量损失敏感性分析是否能实现比启发式或网格搜索方法更优的损失权重配置,以优化mAP?
- RQ5在不修改预测轨迹的前提下,通过显式建模联合置信度,是否能改进简单的边际预测笛卡尔积方法?
主要发现
- $AIR^{2}$ 在Waymo交互预测挑战赛排行榜上取得了0.0963的最高mAP,领先第二名模型(King Crimson)0.0066分。
- 相较于基线Waymo LSTM模型(mAP 0.0524),该模型的性能提升证明了交互感知置信度建模的有效性。
- 使用重栅格化图像——即每个智能体的预测轨迹被重新栅格化并作为交互模型的输入——相比标准栅格化方法进一步提升了性能。
- 对车辆(32个锚点)、行人(8个锚点)和自行车(30个锚点)分别进行聚类,实现了对多样化智能体类型的高效多模态轨迹预测。
- 通过实现类型门控的专家子网络,减少了参数竞争,提升了异构智能体类别间的学习效率。
- 通过集成四个具有不同随机种子和训练快照的模型,实现了稳定的性能增益,凸显了$AIR^{2}$架构的稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。