Skip to main content
QUICK REVIEW

[論文レビュー] Camera-based vehicle velocity estimation from monocular video

Moritz Kampelmühler, Michael G. Müller|arXiv (Cornell University)|Feb 20, 2018
Autonomous Vehicle Technology and Safety参考文献 28被引用数 21
ひとこと要約

本論文は、ビデオトラッカーから抽出した軌跡特徴にのみ依存することで、深層学習ベースの深度および運動特徴を上回る、軽量でリアルタイムな単眼車両速度推定手法を提示する。これらの特徴から多層パーセプトロンを用いて速度を回帰するアプローチにより、テスト誤差1.12 m/sを達成し、LiDARレーダー融合システム(0.71 m/s)に非常に近い性能を発揮し、単一CPU上で動作するCVPR2017コンテストで優勝した。

ABSTRACT

This paper documents the winning entry at the CVPR2017 vehicle velocity estimation challenge. Velocity estimation is an emerging task in autonomous driving which has not yet been thoroughly explored. The goal is to estimate the relative velocity of a specific vehicle from a sequence of images. In this paper, we present a light-weight approach for directly regressing vehicle velocities from their trajectories using a multilayer perceptron. Another contribution is an explorative study of features for monocular vehicle velocity estimation. We find that light-weight trajectory based features outperform depth and motion cues extracted from deep ConvNets, especially for far-distance predictions where current disparity and optical flow estimators are challenged significantly. Our light-weight approach is real-time capable on a single CPU and outperforms all competing entries in the velocity estimation challenge. On the test set, we report an average error of 1.12 m/s which is comparable to a (ground-truth) system that combines LiDAR and radar techniques to achieve an error of around 0.71 m/s.

研究の動機と目的

  • RGB動画のみを用いて自律走行における単眼車両速度推定の新たな課題に取り組むこと。
  • 特に軌跡に基づく特徴と比較して、深層畳み込みニューラルネットワーク(ConvNet)から得られる深度およびオプティカルフロー特徴の有効性を評価すること。
  • 単一CPU上で動作可能なリアルタイムで軽量な回帰モデルを開発すること。
  • 軌跡に基づく特徴のみで、より複雑な運動および深度特徴を上回ることができるかを検証すること。
  • CVPR2017車両速度推定コンテストで最先端の性能を達成すること。

提案手法

  • 2段階のパイプライン:まず、物体追跡により車両の軌跡を抽出し、その後、時間経過に伴い追跡位置で密な深度およびオプティカルフローを推定・集約する。
  • 追跡、深度、オプティカルフローの特徴を時間軸に沿って連結し、空間時間的特徴ベクトルを構築する。
  • 連結された特徴ベクトルから直接的に車両速度を回帰するための多層パーセプトロン(MLP)を訓練する。
  • 検証セットにおける平均二乗誤差(MSE)に基づき、早期停止を用いてモデルを訓練する。
  • アブレーションスタディでは、特徴の組み合わせや距離範囲(近距離、中距離、遠距離)ごとの性能を比較し、各範囲ごとに別々のモデルを訓練する。
  • 推論の高速化を図り、特徴抽出が主な計算ボトルネックとなっている。

実験結果

リサーチクエスチョン

  • RQ1軌跡に基づく特徴は、深層ConvNetから得られる深度およびオプティカルフロー特徴を上回るのか?
  • RQ2異なる距離範囲(近距離、中距離、遠距離)において、異なる特徴セットを用いた場合の性能の違いは何か?
  • RQ3軽量で全結合なネットワークが、単一CPU上でリアルタイム推論を実現しつつ、より複雑なモデルを上回ることができるか?
  • RQ4深層運動および深度推定器の性能は、単眼動画における正確な速度回帰に十分か?
  • RQ5追跡と速度推定を同時に最適化できる単純でエンドツーエンドで訓練可能なシステムを構築できるか?

主な発見

  • 特に遠距離(深度およびオプティカルフロー推定が劣化する)において、軌跡に基づく特徴が、深層ConvNetから得られる深度および運動特徴を上回ることが明らかになった。
  • 追跡特徴のみを用いたモデルは、テスト誤差1.25 m/s(MSE 1.25 m²/s²)を達成し、CVPR2017コンテストで第1位となった。
  • 追跡、フロー、深度特徴を統合したフルモデルは、テスト誤差1.30 m/sを記錪し、追跡特徴のみのモデルよりわずかに劣るが、依然としてコンテストで優勝した。
  • 遠距離(20m以上)の予測において、深度およびフロー特徴は著しく劣化するため、軌跡特徴がより頑健であることが示された。
  • 追跡特徴のみを用いた推論は単一CPUで100 FPSで実行可能であるのに対し、フル特徴処理では約2 FPSにとどまるため、軽量アプローチの効率性が顕著に示された。
  • 本手法の平均誤差1.12 m/sは、LiDARレーダーの真値システム(0.71 m/s)と0.41 m/s以内であり、単眼動画のみで強力な性能を発揮していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。