Skip to main content
QUICK REVIEW

[论文解读] Deep Tracking on the Move: Learning to Track the World from a Moving Vehicle using Recurrent Neural Networks

Julie Dequaire, Dushyant Rao|arXiv (Cornell University)|Sep 29, 2016
Autonomous Vehicle Technology and Safety参考文献 14被引用 15
一句话总结

本文提出一种基于循环神经网络(RNN)与空间变换模块的端到端深度学习框架,从移动车辆的视角追踪城市环境中动态与静态物体。通过利用估计的自身运动,该模型从原始激光扫描中预测无遮挡的占据网格,并能准确追踪物体——包括完全被遮挡的物体——在未来的状态预测和对运动引起的失真具有更强的鲁棒性,优于基线方法。

ABSTRACT

This paper presents an end-to-end approach for tracking static and dynamic objects for an autonomous vehicle driving through crowded urban environments. Unlike traditional approaches to tracking, this method is learned end-to-end, and is able to directly predict a full unoccluded occupancy grid map from raw laser input data. Inspired by the recently presented DeepTracking approach [Ondruska, 2016], we employ a recurrent neural network (RNN) to capture the temporal evolution of the state of the environment, and propose to use Spatial Transformer modules to exploit estimates of the egomotion of the vehicle. Our results demonstrate the ability to track a range of objects, including cars, buses, pedestrians, and cyclists through occlusion, from both moving and stationary platforms, using a single learned model. Experimental results demonstrate that the model can also predict the future states of objects from current inputs, with greater accuracy than previous work.

研究动机与目标

  • 开发一种用于从移动自动驾驶车辆追踪动态城市环境中物体的端到端学习框架。
  • 克服依赖手工设计组件的传统多阶段追踪流水线的局限性。
  • 仅使用原始激光输入,实现对物体状态(包括未来位置和被遮挡轨迹)的精确预测。
  • 通过空间变换模块将估计的自身运动集成到网络中,以提升在车辆运动下的追踪鲁棒性。
  • 在遮挡和长时间追踪中,展示对多样化物体(汽车、行人、自行车、公交车)的优越性能。

提出的方法

  • 模型使用基于门控循环单元(GRU)的RNN,从连续的激光扫描中编码环境的时间演化。
  • 空间变换模块根据估计的自身运动对特征图进行变换,将特征空间对齐到世界坐标系。
  • 网络端到端训练,直接从原始激光输入预测完整的无遮挡占据网格,跳过中间的检测与关联阶段。
  • 使用自身运动估计作为真实车辆运动的代理,以校正传感器与环境之间的相对运动。
  • 该架构使RNN隐藏状态能够记忆物体的位置与速度,从而实现未来状态的预测。
  • 推理期间采用掩码策略,通过每5帧遮蔽输入帧来模拟遮挡,以测试模型对未见遮挡情况的泛化能力。

实验结果

研究问题

  • RQ1端到端深度学习模型是否能在不显式检测或数据关联的情况下,成功追踪多种物体类型在遮挡中的状态?
  • RQ2通过空间变换模块引入估计的自身运动,与静态模型相比,能否显著提升在移动平台上的追踪精度?
  • RQ3仅使用当前输入,该模型在多大程度上能够预测未来物体状态,包括被遮挡的物体?
  • RQ4该模型在具有多样化动态与静态物体的复杂城市场景中,是否能适应真实的车辆运动?
  • RQ5与忽略自身运动的基线模型相比,该模型在长期遮挡情况下的性能表现如何?

主要发现

  • 空间变换模块模型(STM)在预测未来物体状态方面显著优于基线深度追踪模型,尤其在完全遮挡期间及之后。
  • 当一辆移动车辆遮挡两名行人长达五帧时,STM仍能保持准确追踪,而基线模型无法恢复其位置。
  • 尽管基线模型忽略了自身运动,却取得了出人意料的高F1分数,可能归因于数据集中车辆速度相对恒定且静态物体含量较高。
  • STM在所有未来帧中均显著优于基线模型的F1度量,证明了自身运动集成的价值。
  • 该模型成功追踪了汽车、公交车、行人和自行车在遮挡中的状态,即使物体被完全隐藏多帧也未丢失。
  • 该系统在真实城市驾驶条件下表现出良好的泛化能力,包括复杂的相对运动和动态场景变化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。