[论文解读] Camera-based vehicle velocity estimation from monocular video
本文提出了一种轻量级、实时的单目车辆速度估计方法,仅依赖于视频跟踪器提取的轨迹特征,其性能优于基于深度学习的深度和运动线索。通过多层感知机从这些特征回归速度,该方法在测试中达到1.12 m/s的误差——与激光雷达-雷达融合系统(0.71 m/s)的误差极为接近——并在单核CPU上赢得了CVPR2017挑战赛。
This paper documents the winning entry at the CVPR2017 vehicle velocity estimation challenge. Velocity estimation is an emerging task in autonomous driving which has not yet been thoroughly explored. The goal is to estimate the relative velocity of a specific vehicle from a sequence of images. In this paper, we present a light-weight approach for directly regressing vehicle velocities from their trajectories using a multilayer perceptron. Another contribution is an explorative study of features for monocular vehicle velocity estimation. We find that light-weight trajectory based features outperform depth and motion cues extracted from deep ConvNets, especially for far-distance predictions where current disparity and optical flow estimators are challenged significantly. Our light-weight approach is real-time capable on a single CPU and outperforms all competing entries in the velocity estimation challenge. On the test set, we report an average error of 1.12 m/s which is comparable to a (ground-truth) system that combines LiDAR and radar techniques to achieve an error of around 0.71 m/s.
研究动机与目标
- 为自动驾驶中仅使用RGB视频的单目车辆速度估计这一新兴挑战提供解决方案。
- 评估各种视觉特征(尤其是基于轨迹的特征)与基于深度卷积神经网络的深度和光流线索相比的有效性。
- 开发一种可在单核CPU上实时运行的轻量级回归模型。
- 确定仅使用基于轨迹的特征是否能够优于更复杂的运动和深度特征在速度估计中的表现。
- 在CVPR2017车辆速度估计挑战赛中实现最先进性能。
提出的方法
- 两阶段流程:首先,通过目标跟踪提取车辆轨迹;然后,在时间维度上对轨迹位置处的密集深度和光流进行估计并聚合。
- 将跟踪、深度和光流的特征沿时间维度拼接,形成时空特征向量。
- 训练一个多层感知机(MLP),直接从拼接的特征向量回归车辆速度。
- 基于验证集上的均方误差(MSE)使用早停法进行模型训练。
- 消融研究对比了不同特征组合与距离范围(近、中、远)下的性能表现,各距离范围分别训练独立模型。
- 推理过程经过优化以提升速度,其中特征提取为主要计算瓶颈。
实验结果
研究问题
- RQ1基于轨迹的特征是否在单目车辆速度估计中优于基于深度卷积神经网络的深度和光流特征?
- RQ2在不同距离范围(近、中、远)下,使用不同特征集时性能如何变化?
- RQ3轻量级全连接网络是否能在单核CPU上实现实时推理,同时优于更复杂的模型?
- RQ4基于深度学习的运动和深度估计器是否足以实现单目视频中准确的速度回归?
- RQ5能否构建一个简单、端到端可训练的系统,联合优化跟踪与速度估计?
主要发现
- 仅使用基于轨迹的特征即可优于基于深度卷积神经网络的深度和运动线索,尤其在远距离场景中,此时深度和光流估计性能下降。
- 仅使用跟踪特征的模型在测试中达到1.25 m/s的误差(MSE为1.25 m²/s²),在CVPR2017挑战赛中排名第一。
- 融合跟踪、光流和深度特征的完整模型在测试中误差为1.30 m/s,略逊于仅使用跟踪特征的模型,但仍赢得挑战赛。
- 在远距离预测(>20 m)中,深度和光流特征显著退化,而轨迹特征更具鲁棒性。
- 仅使用轨迹特征的推理速度可达100 FPS(单核CPU),而完整特征处理的推理速度约为2 FPS,凸显了轻量级方法的高效性。
- 该方法的平均误差为1.12 m/s,与激光雷达-雷达真值系统(0.71 m/s)的差距仅为0.41 m/s,证明了仅使用单目视频即可实现优异性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。