Skip to main content
QUICK REVIEW

[論文レビュー] Learning Object-specific Distance from a Monocular Image

Jing Zhu, Yi Fang|arXiv (Cornell University)|Sep 9, 2019
Video Surveillance and Tracking Methods参考文献 33被引用数 4
ひとこと要約

本論文は、自律走行車両における単眼RGB画像からのオブジェクト固有の距離推定のための最初のエンドツーエンドディーブラーニングモデルを提案する。ベースモデルにROIプーリングを適用し、精度を向上させるためにキーポイント回帰器とプロジェクション損失を備えた強化モデルを採用することで、特にカメラに近いオブジェクトの推定精度が向上する。本手法は拡張されたKITTIおよびnuScenes(ミニ)データセットにおいて、従来のIPMおよびSVRベースラインを上回り、RMSEが低く、特に曲がりくねった道路や長距離のオブジェクトにおいて高い精度を達成する。

ABSTRACT

Environment perception, including object detection and distance estimation, is one of the most crucial tasks for autonomous driving. Many attentions have been paid on the object detection task, but distance estimation only arouse few interests in the computer vision community. Observing that the traditional inverse perspective mapping algorithm performs poorly for objects far away from the camera or on the curved road, in this paper, we address the challenging distance estimation problem by developing the first end-to-end learning-based model to directly predict distances for given objects in the images. Besides the introduction of a learning-based base model, we further design an enhanced model with a keypoint regressor, where a projection loss is defined to enforce a better distance estimation, especially for objects close to the camera. To facilitate the research on this task, we construct the extented KITTI and nuScenes (mini) object detection datasets with a distance for each object. Our experiments demonstrate that our proposed methods outperform alternative approaches (e.g., the traditional IPM, SVR) on object-specific distance estimation, particularly for the challenging cases that objects are on a curved road. Moreover, the performance margin implies the effectiveness of our enhanced method.

研究の動機と目的

  • 自律走行車両における単眼画像からのオブジェクト固有距離推定という未だ十分に検討されていない課題に取り組むこと。
  • 遠くのオブジェクトや側面を向いたオブジェクト、曲がりくねった道路では失敗する従来の逆投影マッピング(IPM)の限界を克服すること。
  • 推論時にカメラパラメータに依存しない、ディーブラーニングベースのアプローチを考案し、オブジェクトの距離を直接予測すること。
  • 新規のキーポイントベースのプロジェクション損失を用いることで、特にカメラに近いオブジェクトの推定精度を向上させること。
  • LiDARとカメラキャリブレーションから得られる真値距離を用いて、KITTIおよびnuScenes(ミニ)を拡張し、新たなベンチマークデータセットを構築すること。

提案手法

  • RGB画像から特徴を抽出するためにCNN(例:VGG16またはResNet50)を用いるベースモデルを提案。オブジェクトごとに固定サイズの特徴を生成するためにROIプーリングを適用し、全結合層を用いて距離を回帰する。
  • キーポイント回帰器を備えた強化モデルを導入。この回帰器は3次元オブジェクトキーポイントの2次元画像座標(X, Y)を予測し、予測されたZ距離と組み合わせて3次元点を形成する。
  • プロジェクション損失を定義。この損失は、予測された3次元キーポイントがカメラプロジェクション行列を用いて真値の2次元キーポイント位置に正しく投影されることを強制することで、空間的一致性を向上させる。
  • 距離回帰損失とプロジェクション損失の組み合わせを用いて、エンドツーエンドでモデルを訓練。分類器ブランチを併用することで、カテゴリ判別特徴を学習する。
  • カメラパラメータは訓練時のみに使用し、推論時には不要であるため、異なるビジュアルシステムへの一般化が可能になる。
  • LiDAR点群とカメラパラメータを用いてオブジェクト距離を計算し、KITTIおよびnuScenes(ミニ)のオブジェクト検出アノテーションに真値距離を追加することで、拡張データセットを構築する。

実験結果

リサーチクエスチョン

  • RQ1推論時にカメラパラメータに依存しない単一のRGB画像から、オブジェクト固有の距離を直接予測できるディーブラーニングモデルは構築可能か?
  • RQ2キーポイント回帰器とプロジェクション損失を組み合わせることで、特にカメラに近いオブジェクトの距離推定精度はどのように向上するか?
  • RQ3従来のIPMが失敗するような課題的状況、例えば曲がりくねった道路や長距離オブジェクト検出において、提案モデルは一般化可能か?
  • RQ4IPMおよびSVRといった古典的ベースラインと比較して、距離推定精度および推論速度の点で、本モデルは定量的にどの程度優れているか?
  • RQ5分類器の追加により、モデルのオブジェクト距離推定能力はどの程度向上するか?

主な発見

  • 強化モデルはKITTIデータセットでδ1スコア0.629を達成し、ベースモデル(0.587)およびSVR(0.308)を著しく上回り、キーポイントプロジェクション損失の有効性を示している。
  • nuScenes(ミニ)データセットでは、強化モデルがδ1 0.535、RMSE 10.511を達成し、IPM(δ1: 0.441、RMSE: 249.849)およびSVR(δ1: 0.308、RMSE: 18.480)を上回っている。
  • 強化モデルはKITTIにおけるRMSE logを、ベースモデルの0.512から0.314に低減させ、長距離距離推定の性能向上を示している。
  • VGG16を用いた推論時間は1枚あたり16.2msであり、IPM(33.9ms)の2倍速く、SVR(12.1ms)よりも速いため、リアルタイム実行の可能性が示された。
  • 分類器の導入により、AR(平均相対誤差)は、分類器なしベースモデルの0.658から、分類器ありの0.311に改善され、カテゴリに応じた特徴を学習する価値が証明された。
  • 定性的な結果から、本モデルはIPMが失敗する40メートルを超える距離のオブジェクトや曲がりくねった道路でも距離を正確に推定できており、近距離オブジェクトに対しても高い精度を維持していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。