Skip to main content
QUICK REVIEW

[论文解读] Deep Object-Centric Policies for Autonomous Driving

Dequan Wang, Coline Devin|arXiv (Cornell University)|Nov 13, 2018
Advanced Neural Network Applications参考文献 25被引用 6
一句话总结

该论文提出了一种面向自动驾驶的物体中心型深度强化学习策略,通过学习到的稀疏物体检测器显式表示车辆和行人。通过将离散的、基于注意力的物体表征整合到端到端策略中,该方法提升了在复杂城市场景下的鲁棒性——在仿真环境和真实世界低数据量场景下,尤其在碰撞规避和行驶距离指标上,优于无物体感知的基线模型。

ABSTRACT

While learning visuomotor skills in an end-to-end manner is appealing, deep neural networks are often uninterpretable and fail in surprising ways. For robotics tasks, such as autonomous driving, models that explicitly represent objects may be more robust to new scenes and provide intuitive visualizations. We describe a taxonomy of "object-centric" models which leverage both object instances and end-to-end learning. In the Grand Theft Auto V simulator, we show that object-centric models outperform object-agnostic methods in scenes with other vehicles and pedestrians, even with an imperfect detector. We also demonstrate that our architectures perform well on real-world environments by evaluating on the Berkeley DeepDrive Video dataset, where an object-centric model outperforms object-agnostic models in the low-data regimes.

研究动机与目标

  • 通过引入显式的物体表征,解决端到端视觉-运动策略在真实世界自动驾驶中的脆弱性问题。
  • 克服整体性像素级注意力和无物体感知模型在推理过程中处理罕见或未见物体时的局限性。
  • 通过利用具有学习注意力机制的物体中心表征,提升低数据量场景下的样本效率和鲁棒性。
  • 证明稀疏离散物体表征结合每物体注意力机制,优于密集或全局表征,在复杂城市驾驶场景中表现更优。
  • 通过可视化模型认为对控制动作最相关的物体,实现可解释的策略决策。

提出的方法

  • 使用双分支特征提取网络:一个用于全局图像特征,另一个用于从检测到的物体区域(RoI)池化得到的特征。
  • 应用可学习的物体选择层,利用可微分注意力机制为每个检测到的物体计算任务特定的重要性得分。
  • 将全局特征与物体级特征拼接或池化,形成用于策略头的混合表征。
  • 使用专家示范进行模仿学习,端到端训练整个系统,重点在于稀疏物体选择,以减少无关物体带来的噪声。
  • 即使检测结果不完美,也将物体检测器(如在MSCOCO上预训练的)作为弱监督先验引入。
  • 在策略学习中同时评估在线策略(GTAV中的仿真驾驶)和离线策略(真实世界BDDV数据集)设置,以评估泛化能力和数据效率。

实验结果

研究问题

  • RQ1物体中心型表征是否能提升端到端驾驶策略在复杂城市环境中的鲁棒性和样本效率?
  • RQ2在密集与稀疏物体表征之间进行选择,如何影响策略性能和可解释性?
  • RQ3用于物体选择的可学习注意力机制是否优于启发式方法(如基于大小的选择)?
  • RQ4物体中心型模型在检测结果不完美且训练数据有限的真实世界数据中,其泛化能力如何?
  • RQ5在行驶距离、碰撞频率和干预率方面,物体中心型模型与像素级注意力和全局表征基线模型相比表现如何?

主要发现

  • 在Grand Theft Auto V模拟器上的在线策略评估中,采用可学习注意力机制的稀疏物体中心模型,优于无物体感知和像素级注意力模型,实现了更长的行驶距离和更少的碰撞。
  • 在城市环境中,与基线相比,稀疏模型将干预次数减少了30%,平均行驶距离在干预前提升了25%。
  • 即使使用来自预训练检测器(MSCOCO)的物体检测结果,模型仍保持了强劲性能,表明其对噪声或不完美检测具有鲁棒性。
  • 在真实世界的Berkeley DeepDrive Video数据集上,采用特征拼接的稀疏物体模型在低数据量场景(5%–50%数据)下取得了最佳困惑度,表明其具有优越的数据效率。
  • 可学习的选择器在所有指标上均优于基于大小的启发式选择器,证明了注意力与策略联合优化的优势。
  • 模型的注意力机制正确地优先关注行人和邻近车辆,从而导致保守行为(如刹车而非加速靠近障碍物),这一结果在基线模型的失败案例可视化中得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。