Skip to main content
QUICK REVIEW

[論文レビュー] Learning Auxiliary Monocular Contexts Helps Monocular 3D Object Detection

Xianpeng Liu, Nan Xue|arXiv (Cornell University)|Dec 8, 2021
Advanced Neural Network Applications被引用数 7
ひとこと要約

この論文では、モノラル3次元オブジェクト検出のためのシンプルで効果的な手法MonoConを提案する。この手法は、3次元バウンディングボックスから投影された2次元の監視信号(例:コーナーキーポイントやオフセットベクトル)を訓練中の補助タスクとして活用する。軽量な回帰ヘッド設計により、これらのモノラルコンテキストをエンドツーエンドで学習することで、LiDAR や深度推定などの追加データを用いないまま、KITTIベンチマークで最先端の性能(車両のAP@R40が26.33)を達成し、38.7 fpsの高速推論を実現した。

ABSTRACT

Monocular 3D object detection aims to localize 3D bounding boxes in an input single 2D image. It is a highly challenging problem and remains open, especially when no extra information (e.g., depth, lidar and/or multi-frames) can be leveraged in training and/or inference. This paper proposes a simple yet effective formulation for monocular 3D object detection without exploiting any extra information. It presents the MonoCon method which learns Monocular Contexts, as auxiliary tasks in training, to help monocular 3D object detection. The key idea is that with the annotated 3D bounding boxes of objects in an image, there is a rich set of well-posed projected 2D supervision signals available in training, such as the projected corner keypoints and their associated offset vectors with respect to the center of 2D bounding box, which should be exploited as auxiliary tasks in training. The proposed MonoCon is motivated by the Cramer-Wold theorem in measure theory at a high level. In implementation, it utilizes a very simple end-to-end design to justify the effectiveness of learning auxiliary monocular contexts, which consists of three components: a Deep Neural Network (DNN) based feature backbone, a number of regression head branches for learning the essential parameters used in the 3D bounding box prediction, and a number of regression head branches for learning auxiliary contexts. After training, the auxiliary context regression branches are discarded for better inference efficiency. In experiments, the proposed MonoCon is tested in the KITTI benchmark (car, pedestrain and cyclist). It outperforms all prior arts in the leaderboard on car category and obtains comparable performance on pedestrian and cyclist in terms of accuracy. Thanks to the simple design, the proposed MonoCon method obtains the fastest inference speed with 38.7 fps in comparisons

研究の動機と目的

  • 深度、LiDAR、マルチフレームデータに依存せずに、モノラル画像における正確な3次元オブジェクト局在化を実現すること。
  • 3次元バウンディングボックスの投影から得られる豊富で整合性の取れた2次元監視信号を活用して、モノラル3次元検出を向上させること。
  • 検出性能の向上を図るための補助的コンテキスト学習を可能にする、最小限でエンドツーエンドで学習可能なフレームワークを設計すること。
  • アテンション正規化などのアーキテクチャ的改良と比較して、補助的コンテキストの有効性を検証すること。
  • リアルタイムの自律走行アプリケーションに適した、高精度かつ高速な推論速度を達成すること。

提案手法

  • 標準的なConvNetバックボーンを用いて、単一のRGB画像から特徴を抽出する。
  • 3次元中心座標、寸法、方向性といった基本的な3次元検出パラメータを予測するための共有回帰ヘッドモジュールを採用する。
  • 追加の回帰ヘッドを導入し、補助的なモノラルコンテキスト(例えば、2次元座標への投影されたコーナーキーポイント、2次元中心からのオフセットベクトル、その他の幾何的信号)を予測する。
  • 補助ヘッドは主な検出ヘッドと同時にエンドツーエンドで学習され、推論時には破棄されて速度を維持する。
  • この設計は、Cramèr–Wold定理に基づいており、3次元構造の投影を2次元測定値から学ぶ正当性を示している。
  • 補助コンテキストにはクラスに依存しないヘッドを、検出にはクラスに依存するヘッドを用い、車両、歩行者、自転車乗りのカテゴリを統合して訓練する。

実験結果

リサーチクエスチョン

  • RQ13次元バウンディングボックスから投影された2次元監視信号を学習することで、モノラル3次元検出性能が向上するか?
  • RQ2コーナーポイントやオフセットベクトルなどの異なる種類の補助的コンテキストが、検出精度にどのように寄与するか?
  • RQ3提案された補助学習フレームワークは、アテンション正規化などのアーキテクチャ的改良を上回る性能を発揮するか?
  • RQ4補助ヘッドを推論時に破棄する最小限でエンドツーエンドの設計が、高精度かつ高速な推論を達成できるか?
  • RQ5補助コンテキストによる性能向上は、車両、歩行者、自転車乗りといった異なるオブジェクトカテゴリに一貫して見られるか?

主な発見

  • MonoConはKITTIの車両カテゴリでAP@R40が26.33を達成し、リーダーボード上すべての先行手法を上回った。
  • 中程度の難易度設定では19.01 AP@R40、難易度の高い例では15.98を記録した。
  • 再トレーニングされた拡張版MonoDLEモデルと比較して、全難易度レベルで平均3.37%の性能向上を達成した。
  • アブレーションスタディの結果、中程度の難易度下で補助コンテキストがベースラインから8.49%の絶対的向上を示した。
  • 推論速度は38.7 fpsを達成し、最先端手法の中でも最も高速であった。
  • クラスに依存しない補助ヘッドがクラスに依存するものよりも優れており、カテゴリ間の統合学習が全体の性能向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。