Skip to main content
QUICK REVIEW

[论文解读] Explainable Object-induced Action Decision for Autonomous Vehicles

Yiran Xu, Xiaoyin Yang|arXiv (Cornell University)|Mar 20, 2020
Explainable Artificial Intelligence (XAI)参考文献 43被引用 6
一句话总结

本文提出了一种用于自动驾驶车辆的新型可解释决策框架,通过聚焦于引发危险的物体,联合预测驾驶动作及其基于对象的解释。通过引入BDD-OIA数据集和多任务卷积神经网络架构,该方法通过解释监督提升了动作预测的准确性,表明解释通过将决策建立在因果场景推理基础上,能够增强模型性能。

ABSTRACT

A new paradigm is proposed for autonomous driving. The new paradigm lies between the end-to-end and pipelined approaches, and is inspired by how humans solve the problem. While it relies on scene understanding, the latter only considers objects that could originate hazard. These are denoted as action-inducing, since changes in their state should trigger vehicle actions. They also define a set of explanations for these actions, which should be produced jointly with the latter. An extension of the BDD100K dataset, annotated for a set of 4 actions and 21 explanations, is proposed. A new multi-task formulation of the problem, which optimizes the accuracy of both action commands and explanations, is then introduced. A CNN architecture is finally proposed to solve this problem, by combining reasoning about action inducing objects and global scene context. Experimental results show that the requirement of explanations improves the recognition of action-inducing objects, which in turn leads to better action predictions.

研究动机与目标

  • 为解决自动驾驶中可解释性与性能之间的差距,提出一种端到端与流水线系统相结合的混合方法。
  • 识别并聚焦于引发动作的物体——即其状态变化会触发车辆动作的物体——而非场景中的所有物体。
  • 将驾驶动作与解释的联合预测建模为多任务学习问题,以提升模型的鲁棒性与可解释性。
  • 构建一个新的数据集BDD-OIA,包含4种动作和21种解释,用于复杂驾驶场景的标注。
  • 证明解释监督通过提供更丰富且具有因果基础的监督信号,能够提升动作预测性能。

提出的方法

  • 提出一种多任务深度学习框架,通过共享的卷积神经网络主干网络联合预测驾驶动作与解释。
  • 采用Faster R-CNN检测并定位场景中的动作诱发物体。
  • 引入全局场景上下文模块,以推理检测到的物体与驾驶决策的相关性。
  • 使用联合损失函数,同时优化动作预测与解释生成。
  • 将解释映射到有限的语义类别集合中,实现基于分类的解释生成,而非生成式建模。
  • 将解释锚定在特定物体上,确保其基于可观察的场景元素,并与动作存在因果关联。

实验结果

研究问题

  • RQ1联合预测动作与解释是否能提升自动驾驶中动作识别的准确性?
  • RQ2解释监督如何影响对动作诱发物体的检测与推理?
  • RQ3与局部物体特征相比,全局场景特征的上下文推理在多大程度上提升了解释质量?
  • RQ4将解释建模为分类任务是否相比端到端或生成式解释方法能提升性能?
  • RQ5在每帧中包含多种可能动作是否能缓解数据不平衡问题并提升泛化能力?

主要发现

  • 添加解释监督显著提升了动作预测的准确性,表明解释不仅是事后解释,更是有效的学习信号。
  • 在联合预测解释时,模型对动作诱发物体的检测准确率更高,表明其对相关场景元素的关注度得到提升。
  • 全局场景上下文比局部物体特征对解释质量的贡献更大,表明上下文推理是生成有意义解释的关键。
  • 多任务设定减少了模型对常见动作(如“前进”或“减速”)的过度预测倾向,通过更丰富的监督提升了性能。
  • 基于IMU数据的单动作预测导致严重的类别不平衡和泛化性能差,而多动作预测增加了数据多样性,并提升了对稀有动作(如“左转”或“右转”)的性能。
  • 定性结果表明,模型能够成功识别关键的动作诱发物体(如交通灯和行人),同时忽略非动作相关的元素(如停靠的车辆或人行道上的行人)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。