Skip to main content
QUICK REVIEW

[論文レビュー] Disp R-CNN: Stereo 3D Object Detection via Shape Prior Guided Instance Disparity Estimation

Jiaming Sun, Linghao Chen|arXiv (Cornell University)|Apr 7, 2020
Advanced Vision and Imaging参考文献 33被引用数 15
ひとこと要約

本稿では、全画像の視差推定ではなく2次元オブジェクト候補内でのインスタンスレベル視差推定を行うことで、精度と速度を向上させるステレオ3Dオブジェクト検出フレームワークであるDisp R-CNNを提案する。LiDARを用いない状態で統計的形状モデルを活用して高密度の視差偽正例(pseudo-ground-truth)を生成することで、LiDARの教師信号なしでも最先端手法より20%高い平均適合度を達成する。

ABSTRACT

In this paper, we propose a novel system named Disp R-CNN for 3D object detection from stereo images. Many recent works solve this problem by first recovering a point cloud with disparity estimation and then apply a 3D detector. The disparity map is computed for the entire image, which is costly and fails to leverage category-specific prior. In contrast, we design an instance disparity estimation network (iDispNet) that predicts disparity only for pixels on objects of interest and learns a category-specific shape prior for more accurate disparity estimation. To address the challenge from scarcity of disparity annotation in training, we propose to use a statistical shape model to generate dense disparity pseudo-ground-truth without the need of LiDAR point clouds, which makes our system more widely applicable. Experiments on the KITTI dataset show that, even when LiDAR ground-truth is not available at training time, Disp R-CNN achieves competitive performance and outperforms previous state-of-the-art methods by 20% in terms of average precision.

研究の動機と目的

  • ステレオ3Dオブジェクト検出における全画像視差推定の非効率性と不正確さを是正すること。
  • KITTIのような実世界のデータセットにおける高密度視差アノテーションの不足を克服すること。
  • カテゴリ固有の形状事前分布を用いて前景オブジェクトに限定して視差推定を集中させることで、3D検出精度を向上させること。
  • CADモデルから合成された視差偽正例を生成することで、LiDARの真値なしでも効果的な学習を可能にすること。
  • 視差推定をオブジェクト領域に限定することにより、計算コストを削減すること。

提案手法

  • 2次元オブジェクト候補(RoIs)内でのみ視差を予測するインスタンス視差推定ネットワーク(iDispNet)を提案し、焦点を明確にし効率を向上させる。
  • CADモデルにフィットしたPCAベースの統計的形状モデルに基づく形状事前分布を導入し、正確なインスタンスレベル視差予測を可能にする。
  • 統計的形状モデルから3Dオブジェクトメッシュを再構築し、それをレンダリングして高密度視差マップを生成する偽正例生成パイプラインを開発する。
  • 生成された偽正例を用いてiDispNetの学習を監視し、実際のLiDARアノテーションなしで高品質な視差推定を実現する。
  • iDispNetをエンドツーエンドの3D検出パイプラインに統合する:2次元検出 → インスタンス視差推定 → ポイントクラウドからの3Dバウンディングボックス回帰。
  • 幾何的制約とメッシュフィッティングを適用し、偽正例生成における現実的な形状再構築を保証する。

実験結果

リサーチクエスチョン

  • RQ1全画像視差推定と比較して、インスタンスレベル視差推定は3Dオブジェクト検出精度を向上させ得るか?
  • RQ2統計的形状モデルはLiDARなしで信頼性のある視差偽正例を生成できるか?
  • RQ3形状事前分布のガイダンスは、テクスチャが乏しい、または複雑な表面を持つ領域(例:車両)における視差推定を向上させるか?
  • RQ4提案手法は、学習時にLiDARの教師信号なしに最先端の性能を達成できるか?
  • RQ5推論速度において、従来のステレオ3D検出パイプラインと比較して、本手法はどのように差をつけるか?

主な発見

  • KITTI 3D検出ベンチマークにおいて、Disp R-CNNはLiDARの教師信号なしに47%の平均適合度を達成し、以前のSOTA手法を20%上回る。
  • 偽正例監視を用いることで、iDispNetはPSMNet や GA-Net といった全フレーム手法よりも視差および深度のRMSEが低く、特にオブジェクト単位の誤差指標で優位性を示す。
  • インスタンスレベル視差推定により、1枚あたりの推論時間が0.425秒にまで短縮され、探索空間が小さく計算量が削減されるため、大多数の先行ステレオ手法を上回る。
  • 定性的な結果から、iDispNetは全フレーム対比で滑らかでより正確な視差マップを生成し、オブジェクト境界が明確であることが示された。
  • 失敗事例の主な原因は、長距離オブジェクト、強い隠蔽、または統計的形状モデルに適切に表現されていない特殊な形状である。
  • アブレーションスタディにより、インスタンスレベル設計と偽正例監視の両方が性能向上に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。