Skip to main content
QUICK REVIEW

[论文解读] DSDNet: Deep Structured self-Driving Network

Wenyuan Zeng, Shenlong Wang|arXiv (Cornell University)|Aug 13, 2020
Autonomous Vehicle Technology and Safety参考文献 62被引用 12
一句话总结

DSDNet 是一个统一的深度学习框架,通过单个神经网络联合执行自动驾驶车辆的对象检测、多模态运动预测和安全运动规划。它采用基于样本推理的深度结构化能量模型来捕捉社交互动和不确定性,在 nuScenes、ATG4D 和 CARLA-Precog 上的预测准确性和碰撞规避性能显著优于先前方法。

ABSTRACT

In this paper, we propose the Deep Structured self-Driving Network (DSDNet), which performs object detection, motion prediction, and motion planning with a single neural network. Towards this goal, we develop a deep structured energy based model which considers the interactions between actors and produces socially consistent multimodal future predictions. Furthermore, DSDNet explicitly exploits the predicted future distributions of actors to plan a safe maneuver by using a structured planning cost. Our sample-based formulation allows us to overcome the difficulty in probabilistic inference of continuous random variables. Experiments on a number of large-scale self driving datasets demonstrate that our model significantly outperforms the state-of-the-art.

研究动机与目标

  • 开发一个统一的深度学习框架,联合执行自动驾驶中的对象检测、运动预测与运动规划。
  • 对交通参与者之间的复杂社交互动进行建模,实现校准的多模态未来预测。
  • 通过显式整合不确定性与交互感知的未来分布,提升运动规划的安全性。
  • 克服在高维场景中对连续轨迹进行概率推理的计算挑战。
  • 在真实世界与仿真数据集上展示联合学习的有效性,证明其在安全性与准确性方面优于先前方法。

提出的方法

  • 使用深度结构化能量模型(EBM)对所有参与者未来轨迹的联合分布进行参数化,显式建模交互作用。
  • 采用基于样本的推理框架,对连续轨迹进行采样,并利用信念传播高效计算边缘分布。
  • 提出一种结构化运动规划代价函数,结合数据驱动学习的代价与人类先验知识(如碰撞规避、交通规则)。
  • 利用共享的 CNN 主干网络处理 LiDAR 和高清地图输入,实现检测、预测与规划的端到端联合优化。
  • 在推理过程中,对采样轨迹集进行消息传递,以在参与者之间传播不确定性和交互信息。
  • 采用类似变分自编码器的潜在空间进行多模态预测,但将隐式分布替换为对采样轨迹的显式非参数建模。

实验结果

研究问题

  • RQ1单个深度神经网络能否有效统一自动驾驶中的感知、运动预测与规划?
  • RQ2如何在实现校准不确定性的多模态未来预测中显式建模交通参与者之间的社交互动?
  • RQ3在多模态未来预测中引入不确定性在多大程度上能提升运动规划的安全性与性能?
  • RQ4基于连续轨迹的样本推理能否为高维运动预测中的传统概率推理提供一种高效且可扩展的替代方案?
  • RQ5结合学习到的知识与人类先验知识的结构化规划代价,能在多大程度上提升碰撞规避与交通规则遵守能力?

主要发现

  • 在 nuScenes 数据集上,DSDNet 的预测碰撞率为 0.2‰,显著优于先前最先进方法;当仅建模多模态时碰撞率为 2.4‰,不建模交互作用时为 4.9‰。
  • 同时包含多模态与成对交互建模可将预测 L2 误差降低至 1.22m,而若两者均不使用则误差为 1.28m。
  • 在运动规划中引入多模态预测可将碰撞率降至 0.26%,而仅使用最可能预测时碰撞率为 0.45%。
  • 尽管输入分辨率较小(500×500 vs. 1000×1000),DSDNet 的检测性能仍与最先进 LiDAR 检测器(如 Megvii)相当,表明多任务学习未导致检测性能下降。
  • 定性结果表明,DSDNet 能够在交叉路口准确捕捉多模态行为(如车辆决定转弯或让行),同时生成平滑、符合车道规则且无碰撞的轨迹。
  • 消融实验确认,多模态预测与交互建模均对降低碰撞率至关重要,当两者结合使用时获得最显著的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。