Skip to main content
QUICK REVIEW

[論文レビュー] Confidence Guided Stereo 3D Object Detection with Split Depth Estimation

Chengyao Li, Jason S. Ku|arXiv (Cornell University)|Mar 11, 2020
Advanced Vision and Imaging参考文献 36被引用数 12
ひとこと要約

本論文では、前景ピクセルと背景ピクセルのための別個の深度デコーダを用い、検出器におけるソフトアテンションメカニズムとして信頼度推定値を活用する、信頼度誘導型ステレオ3次元オブジェクト検出フレームワーク、CG-Stereoを提案する。本手法はKITTIベンチマークにおいて最先端の性能を達成し、車両、歩行者、自転車の各クラスで、それぞれ1.4%、6.7%、12.7%のAP向上を達成した(0.7 IoU基準)。

ABSTRACT

Accurate and reliable 3D object detection is vital to safe autonomous driving. Despite recent developments, the performance gap between stereo-based methods and LiDAR-based methods is still considerable. Accurate depth estimation is crucial to the performance of stereo-based 3D object detection methods, particularly for those pixels associated with objects in the foreground. Moreover, stereo-based methods suffer from high variance in the depth estimation accuracy, which is often not considered in the object detection pipeline. To tackle these two issues, we propose CG-Stereo, a confidence-guided stereo 3D object detection pipeline that uses separate decoders for foreground and background pixels during depth estimation, and leverages the confidence estimation from the depth estimation network as a soft attention mechanism in the 3D object detector. Our approach outperforms all state-of-the-art stereo-based 3D detectors on the KITTI benchmark.

研究の動機と目的

  • 前景オブジェクトの深度推定精度を向上させることで、ステレオベースとLiDARベースの3次元オブジェクト検出の性能ギャップを埋める。
  • 特に遠方やオブジェクト境界付近で顕著な深度推定精度のばらつきを是正すること。
  • 深度予測からの不確実性推定値を3次元検出器におけるソフトアテンションメカニズムとして統合し、検出のロバスト性を向上させること。
  • ステレオ画像のみを用いてKITTI 3次元オブジェクト検出ベンチマークで最先端の性能を示すこと。

提案手法

  • ステレオマッチングネットワークは、セマンティックセグメンテーションマスクを用いて分離を誘導する前景ピクセル用と背景ピクセル用の別個のデコーダを採用する。
  • 訓練時にポイントクラウド損失を適用し、オブジェクト形状を保持するとともに、遠方または複雑なオブジェクトの深度推定精度を向上させる。
  • 深度推定ネットワークからの信頼度マップをポイントクラウドに追加のチャネルとして加え、3次元検出器におけるソフトアテンションメカニズムとして機能させる。
  • 3次元オブジェクト検出器は、信頼度が高くて正確な深度ポイントに注目し、ノイズや曖昧なポイントを抑制できるように、信頼度増強ポイントクラウドを処理する。
  • 全パイプラインはエンドツーエンドで訓練され、深度推定と3次元検出のブランチが共同最適化される。
  • セマンティックセグメンテーションマスクを用いて深度推定時に前景と背景を分離することで、オブジェクト固有の深度パターンの学習が向上する。

実験結果

リサーチクエスチョン

  • RQ1前景と背景ピクセルのための別個の深度推定は、ステレオベースシステムにおける3次元オブジェクト検出性能を向上させ得るか?
  • RQ2深度予測からの信頼度推定値をソフトアテンションメカニズムとして統合することで、3次元検出器のロバスト性と精度が向上するか?
  • RQ3ポイントクラウド損失を用いた分離深度推定は、遠方または困難なオブジェクトの深度推定精度にどのように影響するか?
  • RQ4高品質なセマンティックセグメンテーションマスクを用いた場合、本手法の上限性能はどの程度か?

主な発見

  • 提案手法はKITTIベンチマークにおいて、車両の0.7 IoU基準で57.58%のAPを達成し、次善の手法を1.4%のAP向上で上回った。
  • 歩行者に関しては、次善のステレオベース手法よりも6.7%のAP向上を達成した。
  • 自転車に関しては12.7%のAP向上を達成し、小形で困難なオブジェクトクラスにおいて顕著な向上を示した。
  • アブレーションスタディでは、分離深度推定のみでAPが1.81%、AP_BEVが1.31%向上した。
  • ポイントクラウド損失を追加することで、APがさらに2.27%、AP_BEVが0.29%向上した。
  • 信頼度をソフトアテンションメカニズムとして統合することで、APが1.02%、AP_BEVが1.73%向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。