[论文解读] CausalAgents: A Robustness Benchmark for Motion Forecasting using Causal Relationships
本文提出了 CausalAgents,一个用于运动预测模型的鲁棒性基准,通过移除非因果智能体(即其消失不会改变自动驾驶车辆(AV)真实轨迹的智能体)来评估模型对扰动的敏感性。这些非因果智能体通过在 Waymo Open Motion Dataset 上的人工标注识别。主要贡献在于提出了一种新的评估协议,揭示了当前最先进模型在该类扰动下 minADE 相对增加高达 38%,凸显其对虚假相关性的脆弱性;而数据增强和更大规模数据集则能提升鲁棒性。
As machine learning models become increasingly prevalent in motion forecasting for autonomous vehicles (AVs), it is critical to ensure that model predictions are safe and reliable. However, exhaustively collecting and labeling the data necessary to fully test the long tail of rare and challenging scenarios is difficult and expensive. In this work, we construct a new benchmark for evaluating and improving model robustness by applying perturbations to existing data. Specifically, we conduct an extensive labeling effort to identify causal agents, or agents whose presence influences human drivers' behavior in any format, in the Waymo Open Motion Dataset (WOMD), and we use these labels to perturb the data by deleting non-causal agents from the scene. We evaluate a diverse set of state-of-the-art deep-learning model architectures on our proposed benchmark and find that all models exhibit large shifts under even non-causal perturbation: we observe a 25-38% relative change in minADE as compared to the original. We also investigate techniques to improve model robustness, including increasing the training dataset size and using targeted data augmentations that randomly drop non-causal agents throughout training. Finally, we release the causal agent labels (at https://github.com/google-research/causal-agents) as an additional attribute to WOMD and the robustness benchmarks to aid the community in building more reliable and safe deep-learning models for motion forecasting.
研究动机与目标
- 为解决自动驾驶中模型鲁棒性评估的挑战,特别是针对昂贵且难以收集与标注的罕见和复杂场景。
- 开发一个基准,通过删除非因果智能体来扰动现有数据,测试模型对虚假相关性的敏感性。
- 引入不依赖真实轨迹的新指标,量化模型鲁棒性,用于敏感性评估。
- 探究数据增强和训练数据量增加是否能提升模型对非因果智能体删除的鲁棒性。
- 将因果智能体标注作为扩展属性发布至 Waymo Open Motion Dataset,以支持未来在鲁棒运动预测方面的研究。
提出的方法
- 人工标注者在 Waymo Open Motion Dataset (WOMD) 中标注了因果智能体,将非因果智能体定义为:其移除不会改变目标 AV 的真实轨迹。
- 作者通过从场景中删除所有非因果智能体,构建了扰动后的基准数据集,同时保留目标智能体的原始真实轨迹。
- 引入两种新指标:(1) 每个样本 minADE 的绝对变化,用于衡量敏感性;(2) 基于 IoU 的轨迹集合指标,用于评估模型输出偏移,而无需参考真实轨迹。
- 在原始数据集和扰动数据集上评估最先进模型(如 Multipath++、SceneTransformer、Wayformer),以测量性能变化。
- 研究中采用了有针对性的数据增强策略,即在训练过程中随机删除非因果智能体,以提升鲁棒性。
- 通过改变被移除智能体的数量(包括因果、非因果和静止智能体),分析模型鲁棒性,以隔离失败模式。
实验结果
研究问题
- RQ1最先进运动预测模型对非因果智能体(其存在不影响 AV 真实轨迹)的移除有多敏感?
- RQ2新型鲁棒性指标(尤其是不依赖真实轨迹的指标)是否能有效捕捉模型对扰动的敏感性?
- RQ3增加训练数据集规模或应用有针对性的数据增强(如训练时随机删除非因果智能体)是否能提升模型对这类扰动的鲁棒性?
- RQ4模型在非因果扰动下脆弱性的根本原因是什么?过拟合或对上下文智能体的过度依赖等因素如何影响表现?
- RQ5当非因果智能体被移除时,模型预测在多大程度上偏离道路图规则,或表现出模式崩溃?
主要发现
- 所有评估的最先进模型在非因果智能体被移除后均表现出显著性能下降,minADE 相对于原始数据集相对增加 25% 至 38%,表明对虚假特征高度敏感。
- 在原始数据集上 minADE 最准确的模型并非最鲁棒的,表明标准性能指标与鲁棒性之间存在脱节。
- 在长尾分布中,部分样本表现出极端敏感性,minADE 变化超过 1 米(最高达 8 米),尽管大多数样本变化极小。
- 令人惊讶的是,在相当大比例的案例中,移除因果或非因果智能体反而改善了 minADE,表明模型在扰动下表现出复杂且非单调的行为。
- 增加训练数据集规模并应用在训练过程中随机删除非因果智能体的数据增强策略,显著提升了鲁棒性,降低了相对敏感性。
- 可视化分析显示,模型失败通常与错误的模式预测(如遗漏右转模式)以及智能体删除后违反道路图规则有关,表明模型过度依赖上下文智能体而非地图信息。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。