[论文解读] Grounded Relational Inference: Domain Knowledge Driven Explainable Autonomous Driving
本文提出了一种基于知识的关联推理(GRI)方法,通过将领域知识融入关联潜在空间,生成具有语义意义的交互图,以实现可解释的自动驾驶。通过将潜在变量与专家定义的行为(如让行和切入)对齐,GRI 确保解释与因果机制及人类可理解的交通规则一致,在变道场景中达到 99.95% 的准确率,并在鲁棒性上优于基线方法。
Explainability is essential for autonomous vehicles and other robotics systems interacting with humans and other objects during operation. Humans need to understand and anticipate the actions taken by the machines for trustful and safe cooperation. In this work, we aim to develop an explainable model that generates explanations consistent with both human domain knowledge and the model's inherent causal relation. In particular, we focus on an essential building block of autonomous driving, multi-agent interaction modeling. We propose Grounded Relational Inference (GRI). It models an interactive system's underlying dynamics by inferring an interaction graph representing the agents' relations. We ensure a semantically meaningful interaction graph by grounding the relational latent space into semantic interactive behaviors defined with expert domain knowledge. We demonstrate that it can model interactive traffic scenarios under both simulation and real-world settings, and generate semantic graphs explaining the vehicle's behavior by their interactions.
研究动机与目标
- 为解决深度学习模型在自动驾驶中缺乏透明性的问题,该问题阻碍了人类信任与协作。
- 通过确保解释与模型因果性及人类领域知识一致,克服事后解释的模糊性。
- 开发一种关联推理框架,生成具有明确语义意义的交互图(如让行或切入),而非不可解释的潜在聚类。
- 通过使用专家定义的交互行为对关联潜在空间进行约束,提升多智能体交通场景中的模型可解释性。
- 验证所生成的交互图不仅能解释行为,还能与交通规则和现实世界动态保持一致,指导策略学习。
提出的方法
- GRI 通过引入结构化语义奖励函数,扩展了神经关联推理(NRI),将潜在交互变量映射到预定义行为(如让行和切入)。
- 该方法使用对抗性逆强化学习(AIRL)训练策略,使其生成的行为与语义交互图一致。
- 设计了语义奖励函数,根据观测交互是否匹配专家定义的行为来分配奖励,确保潜在空间与领域知识对齐。
- 通过变分推理框架推断交互图,以最大化观测轨迹的似然性,同时最小化潜在变量的信息瓶颈。
- 策略解码器利用推断出的交互图生成控制动作,确保决策与可解释的智能体交互存在因果关联。
- 模型通过联合目标端到端训练,结合轨迹重建、策略优化和通过结构化奖励函数实现的语义对齐。
实验结果
研究问题
- RQ1在不牺牲性能的前提下,将关联潜在空间基于专家定义的交互行为进行约束,是否能提升自动驾驶模型的可解释性?
- RQ2在多智能体交通场景中,引入语义奖励函数如何影响关联推理的质量与稳定性?
- RQ3所推断的交互图在多大程度上能以人类可理解的行为(如让行或切入)来解释车辆行为?
- RQ4与端到端或事后解释方法相比,采用语义对齐的关联推理是否能生成更鲁棒且泛化能力更强的策略?
- RQ5在关联推理中使用结构化奖励函数时,重建准确率与语义可解释性之间的权衡如何?
主要发现
- 在变道场景中,GRI 对交互类型分类的准确率达到 99.95%,显著优于 GRI-VAIRL(50.0%)和 GRI-AIRL(未报告准确率),证明了语义对齐的必要性。
- 在跟车场景中,GRI-VAIRL(无语义奖励)达到 100% 准确率且 RMSE 更低,优于 GRI-AIRL,表明关联推理本身可提升稳定性和收敛性。
- 在跟车场景中,GRI 的 x 位置 RMSE 最低(0.241±0.125 m),速度 RMSE 最低(0.174±0.068 m/s),表现出优异的重建性能。
- 尽管 GRI-VAIRL 在变道场景中准确率较低,但其收敛速度更快,对超参数的敏感性更低,表明关联推理增强了训练稳定性。
- 引入语义奖励函数导致重建性能略有下降,表明可解释性与建模能力之间存在权衡。
- 在合成场景中,模型成功推断出与真实语义一致的交互图,GRI 生成的边类型具有明确语义,对应现实世界行为如让行和切入。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。