Skip to main content
QUICK REVIEW

[论文解读] Egocentric Vision-based Future Vehicle Localization for Intelligent Driving Assistance Systems

Yu Yao, Mingze Xu|arXiv (Cornell University)|Sep 19, 2018
Autonomous Vehicle Technology and Safety被引用 6
一句话总结

该论文提出了一种用于第一视角(egocentric)视觉未来车辆定位的多流RNN编码器-解码器模型,通过利用过去的车辆位置、图像特征、密集光流和预测的自身运动来提升轨迹预测性能。该方法在新提出的HEV-I数据集和KITTI数据集上均取得了最先进(SOTA)的性能,FDE得分为25.56,显著优于基线模型,充分证明了光流和自身运动建模的关键作用。

ABSTRACT

Predicting the future location of vehicles is essential for safety-critical applications such as advanced driver assistance systems (ADAS) and autonomous driving. This paper introduces a novel approach to simultaneously predict both the location and scale of target vehicles in the first-person (egocentric) view of an ego-vehicle. We present a multi-stream recurrent neural network (RNN) encoder-decoder model that separately captures both object location and scale and pixel-level observations for future vehicle localization. We show that incorporating dense optical flow improves prediction results significantly since it captures information about motion as well as appearance change. We also find that explicitly modeling future motion of the ego-vehicle improves the prediction accuracy, which could be especially beneficial in intelligent and automated vehicles that have motion planning capability. To evaluate the performance of our approach, we present a new dataset of first-person videos collected from a variety of scenarios at road intersections, which are particularly challenging moments for prediction because vehicle trajectories are diverse and dynamic.

研究动机与目标

  • 为解决智能驾驶系统中在第一视角(egocentric)视频中预测未来车辆位置和尺度的挑战。
  • 开发一种鲁棒的时序建模框架,以捕捉动态城市交叉路口中的运动与外观变化。
  • 构建一个新的、多样化的第一视角视频数据集,专注于复杂交叉路口场景,以支持未来研究。
  • 评估光流和未来自身运动对复杂驾驶环境中预测精度的影响。
  • 在所提出的HEV-I和现有的KITTI数据集上均展示最先进性能。

提出的方法

  • 提出一种多流RNN编码器-解码器(RNN-ED)架构,用于处理多个输入流:过去的车辆边界框、图像特征、密集光流和未来自身运动。
  • 模型为每个输入流使用独立的编码器,共享一个解码器,以随时间生成未来的边界框。
  • 将密集光流作为关键输入流,以捕捉帧间运动与外观变化。
  • 显式地将未来自身运动作为输入,以提升预测精度,尤其在存在规划性操作的场景中。
  • 模型采用时序更新机制,使每个未来的预测都基于前一隐藏状态,从而实现比一次性生成更优的长期轨迹建模。
  • 框架通过端到端训练,使用真实未来边界框作为监督信号,损失函数针对位置和尺度进行优化。

实验结果

研究问题

  • RQ1基于第一视角视觉的方法能否有效预测复杂城市交叉路口中未来车辆的位置和尺度?
  • RQ2引入密集光流在第一视角视频中如何提升未来车辆定位的准确性?
  • RQ3在动态驾驶场景中,建模未来自身运动在多大程度上能提升预测性能?
  • RQ4所提出的多流RNN-ED架构与卷积-反卷积模型相比,在时序建模能力上表现如何?
  • RQ5该方法在HEV-I和KITTI等多样化数据集上的泛化能力如何?

主要发现

  • 所提出的RNN-ED-XOE模型在HEV-I数据集上达到24.92的最终FDE,显著优于线性基线(72.37)和恒定加速度基线(58.00)。
  • 与最先进方法相比,性能提升约15%,FDE从29.06降至25.56。
  • 消融实验确认,密集光流至关重要,当加入模型后,FDE从34.04降至25.56。
  • 进一步引入未来自身运动可进一步提升性能,在HEV-I数据集上取得最佳FDE为24.92。
  • 在KITTI数据集上,模型FDE为37.11,优于Conv1D基线(78.19)及其他基线,尽管性能低于在HEV-I上的表现,可能由于数据集规模和复杂性所致。
  • 定性结果表明,该模型能更好地捕捉曲线和长轨迹,并在遮挡和边界效应处理上比Conv1D基线更具鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。