Skip to main content
QUICK REVIEW

[論文レビュー] Weakly Supervised Training of Monocular 3D Object Detectors Using Wide Baseline Multi-view Traffic Camera Data

Matthew D. Howe, Ian Reid|arXiv (Cornell University)|Oct 21, 2021
Advanced Neural Network Applications被引用数 6
ひとこと要約

本稿では、重複する広基準距離マルチビューカメラデータを用いて、交通交差点監視のための単眼3次元オブジェクト検出器を弱教師付きで微調整する手法を提案する。事前学習済み検出器と、複数の視点間で幾何的整合性を強制するマルチビューリプロジェクション損失を活用することで、3Dオブジェクト検出器の7DoF車両ポーズ精度を、完全教師ありの最先端モデルと同等の水準にまで高めることができ、微調整にわずか10分間のラベルなしマルチビュービデオで十分である。

ABSTRACT

Accurate 7DoF prediction of vehicles at an intersection is an important task for assessing potential conflicts between road users. In principle, this could be achieved by a single camera system that is capable of detecting the pose of each vehicle but this would require a large, accurately labelled dataset from which to train the detector. Although large vehicle pose datasets exist (ostensibly developed for autonomous vehicles), we find training on these datasets inadequate. These datasets contain images from a ground level viewpoint, whereas an ideal view for intersection observation would be elevated higher above the road surface. We develop an alternative approach using a weakly supervised method of fine tuning 3D object detectors for traffic observation cameras; showing in the process that large existing autonomous vehicle datasets can be leveraged for pre-training. To fine-tune the monocular 3D object detector, our method utilises multiple 2D detections from overlapping, wide-baseline views and a loss that encodes the subjacent geometric consistency. Our method achieves vehicle 7DoF pose prediction accuracy on our dataset comparable to the top performing monocular 3D object detectors on autonomous vehicle datasets. We present our training methodology, multi-view reprojection loss, and dataset.

研究の動機と目的

  • 自車両面の単眼3次元検出器と上空の交差点監視カメラとの間のドメインギャップを解消すること。
  • 高価なLiDARや手動3次元アノテーションを一切用いずに、都市部の交差点における車両ポーズ推定(位置、サイズ、ヨー角)を高精度に行えるようにすること。
  • 2次元検出結果と複数視点間の幾何的整合性のみを用いる弱教師付き学習手法を開発すること。
  • 評価のための1,651件の手動ラベル付き7DoFポーズを含む、45,000台の自動アノテーション車両を有する新しいマルチビューデータセット(WIBAM)を公開すること。
  • 10分間のマルチビュービデオでの微調整により、完全教師ありの最先端モデルと同等の性能を達成できることを実証すること。

提案手法

  • 事前学習済み単眼3次元オブジェクト検出器を、弱教師付きマルチビューリプロジェクション損失を用いて微調整する。
  • 重複する広基準距離カメラビューを用い、事前学習済み2次元検出器から得られる2次元検出結果を弱教師信号として活用する。
  • 複数のカメラビュー間での3次元検出結果のリプロジェクション誤差を最小化することで、幾何的整合性を強制する。
  • 事前学習モデルの3次元予測ヘッドを活用して検出器を初期化することで、大規模な3次元アノテーションの必要性を低減する。
  • エンドツーエンド学習中に損失を適用し、3次元バウンディングボックス予測と幾何的整合性を同時に最適化する。
  • 信頼性の高い性能評価を確保するため、手動ラベル付きテストセット作成のためのマルチビューアノテーションツールを用いる。

実験結果

リサーチクエスチョン

  • RQ1自車両面の単眼3次元オブジェクト検出器を、上空の交差点監視カメラ用に効果的に微調整できるか?
  • RQ23次元アノテーションが存在しない状況下でも、重複する視点間の幾何的整合性が強力な教師信号として機能するか?
  • RQ3完全教師ありモデルと同等の性能を得るために、どの程度のマルチビューデータが必要か?
  • RQ4弱教師付き手法により、交通安全性研究における高コストな手動3次元ラベリングの必要性を低減できるか?
  • RQ5提案手法は、実世界の交差点データにおいて、ベースラインモデルと比較して7DoFポーズ精度を向上させるか?

主な発見

  • WIBAMモデルは、NuScenesデータセットにおける完全教師あり最先端モデルと同等の水準で、WIBAMテストセットにおける7DoFポーズ予測精度を達成した。
  • WIBAMテストセットにおいて、2次元検出誤差(ATE)を0.41m、3次元サイズ誤差(ASE)を0.22m、ヨー角誤差(AOE)を4.69°まで低減した。
  • 12.5 FPSのマルチビューデータから得た10分間の動画クリップが、ベースラインモデルと比較して3次元IoUを顕著に向上させるのに十分な教師信号を提供した。
  • 定性的な結果から、遮蔽や断片化された車両に対しても、時間経過に伴い一貫性があり高精度な3次元バウンディングボックス予測が得られていることが示された。
  • マルチビューリプロジェクション損失は、新しいカメラドメインにおける事前学習モデルが引き起こす局所化誤差やサイズ誤差を効果的に是正した。
  • WIBAMデータセットには、45,000台の自動アノテーション車両(116,000個の2次元ボックス)と1,651件の手動ラベル付き7DoFポーズが含まれており、再現可能な評価が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。