Skip to main content
QUICK REVIEW

[論文レビュー] Camera Height Doesn't Change: Unsupervised Training for Metric Monocular Road-Scene Depth Estimation

Genki Kinoshita, Ko Nishino|arXiv (Cornell University)|Dec 7, 2023
Advanced Vision and Imaging被引用数 4
ひとこと要約

本稿では、外見から車両の寸法を推定し、それらの手がかりを1つの不変測定値(カメラ高さ)に統合することで、任意の補助センサーやスケールの教師信号なしにメトリックな深度推定を可能にする、新しい非教師付き単眼深度推定フレームワーク、StableCamHを提案する。本手法は、フレームとエポックにわたるカメラ高さの最適化により、KITTIおよびCityscapesで最先端の精度を達成し、一貫性がありスケールに注意を払った深度予測を実現する。

ABSTRACT

In this paper, we introduce a novel training method for making any monocular depth network learn absolute scale and estimate metric road-scene depth just from regular training data, i.e., driving videos. We refer to this training framework as FUMET. The key idea is to leverage cars found on the road as sources of scale supervision and to incorporate them in network training robustly. FUMET detects and estimates the sizes of cars in a frame and aggregates scale information extracted from them into an estimate of the camera height whose consistency across the entire video sequence is enforced as scale supervision. This realizes robust unsupervised training of any, otherwise scale-oblivious, monocular depth network so that they become not only scale-aware but also metric-accurate without the need for auxiliary sensors and extra supervision. Extensive experiments on the KITTI and the Cityscapes datasets show the effectiveness of FUMET, which achieves state-of-the-art accuracy. We also show that FUMET enables training on mixed datasets of different camera heights, which leads to larger-scale training and better generalization. Metric depth reconstruction is essential in any road-scene visual modeling, and FUMET democratizes its deployment by establishing the means to convert any model into a metric depth estimator.

研究の動機と目的

  • 道路シーンにおける物体サイズの事前知識を活用することで、非教師付き単眼深度推定におけるスケールの曖昧性を解消すること。
  • 現実世界のシーンにおける誤った局所化やドメインシフトの影響を受ける直接的な物体サイズ事前知識の脆さを克服すること。
  • GPS、IMU、深度センサを必要とせず、任意の単眼深度推定器をスケールに注意を払ったものにすることを可能にする自己教師学習フレームワークの開発。
  • フレームとトレーニングエポックにわたるカメラ高さの不変性を強制することで、動画シーケンス全体で一貫性のある深度推定を実現すること。
  • 手動アノテーションなしで、外見からのみ車両寸法を推定可能な汎用的で事前学習されたサイズ事前知識の構築。

提案手法

  • 動画シーケンス内のすべてのフレームに共通する不変な物理的測定値としてのカメラ高さを共有することで、単眼深度推定をカメラ高さの最適化問題として定式化する。
  • 予測された深度マップからスケールなしのカメラ高さ推定値を導出する微分可能なカメラ高さ計算モジュールを導入する。
  • ウェブから収集した車両画像とそのアノテーション済み寸法を用いて訓練された、新しい学習されたサイズ事前知識ネットワークを導入し、物体の外見から車両寸法(長さ、幅、高さ)を直接予測する。
  • スケルトンプロジェクタを用いて深度マップから物体のスケルトン高さを抽出し、学習されたサイズ事前知識の予測と比較することで、フレームごとのスケール要因を計算する。
  • スケール要因をスケールなしのカメラ高さに適用することで、各フレームごとのスケーリング済みカメラ高さ推定値を計算し、メトリックな監視を可能にする。
  • 中央値演算と重み付き移動平均を用いて、すべてのフレームとトレーニングエポックにわたるカメラ高さを最適化し、不変性を強制し、トレーニングの安定化を図る。

実験結果

リサーチクエスチョン

  • RQ1動画シーケンス全体にわたるカメラ高さの不変性を、単眼深度推定におけるスケールの曖昧性を解消する自己教師信号として利用できるか?
  • RQ2現実世界のドライブシーンにおける局所化誤差やドメインシフトに強く、物体サイズ事前知識をどのようにして強化できるか?
  • RQ3ウェブスクリーピングされたデータで学習した学習ベースのサイズ事前知識は、手動アノテーションなしに外見からのみ車両寸法を正確に予測できるか?
  • RQ4トレーニング中にオンラインでカメラ高さを最適化することで、固定された擬似教師信号に比べて深度推定の精度が向上するか?
  • RQ5提案されたフレームワークは、KITTI や Cityscapes などの多様なデータセットに跨り、任意の単眼深度推定モデルと互換性を持つのか?

主な発見

  • StableCamHは、KITTIおよびCityscapesベンチマークにおいて、既存の弱教師付き手法を上回る最先端の絶対スケール深度推定性能を達成する。
  • オンラインカメラ高さ最適化を用いて訓練したモデルは、固定された擬似教師信号に比べて高い精度を示し、エンドツーエンドの不変性学習の有効性を裏付ける。
  • 微調整されたカメラ高さ戦略はさらに性能を向上させ、追加の事前学習が精度向上に寄与することを示している。
  • 学習されたサイズ事前知識は、データセット間で強く一般化され、固定事前知識や同等の3D検出モデル(MonoCInIS)と比較して寸法推定の絶対相対誤差が低く抑えられている。
  • KITTIでは、学習されたサイズ事前知識は固定事前知識(1.59m)およびMonoCInISを下回る誤差を示しており、特に未学習ドメインにおいて顕著である。
  • 本手法は、深度またはスケールの教師信号なしに完全に非教師学習を可能にし、任意の屋外ドライブ動画に適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。