[論文レビュー] Metric3D: Towards Zero-shot Metric 3D Prediction from A Single Image
Metric3Dは、多様なカメラモデル間の計測的曖昧性を解消するための標準化カメラ空間変換モジュールを提案し、1枚の画像からのゼロショット計測的3次元再構成を可能にする。800万枚の画像と数千種類のカメラタイプで訓練することで、7つのゼロショットベンチマークで最先端の性能を達成し、第2回モノクローラ深度推定コンテストで優勝。スケールドリフトなしに実世界の画像から正確な計測的深度を回復可能である。
Reconstructing accurate 3D scenes from images is a long-standing vision task. Due to the ill-posedness of the single-image reconstruction problem, most well-established methods are built upon multi-view geometry. State-of-the-art (SOTA) monocular metric depth estimation methods can only handle a single camera model and are unable to perform mixed-data training due to the metric ambiguity. Meanwhile, SOTA monocular methods trained on large mixed datasets achieve zero-shot generalization by learning affine-invariant depths, which cannot recover real-world metrics. In this work, we show that the key to a zero-shot single-view metric depth model lies in the combination of large-scale data training and resolving the metric ambiguity from various camera models. We propose a canonical camera space transformation module, which explicitly addresses the ambiguity problems and can be effortlessly plugged into existing monocular models. Equipped with our module, monocular models can be stably trained with over 8 million images with thousands of camera models, resulting in zero-shot generalization to in-the-wild images with unseen camera settings. Experiments demonstrate SOTA performance of our method on 7 zero-shot benchmarks. Notably, our method won the championship in the 2nd Monocular Depth Estimation Challenge. Our method enables the accurate recovery of metric 3D structures on randomly collected internet images, paving the way for plausible single-image metrology. The potential benefits extend to downstream tasks, which can be significantly improved by simply plugging in our model. For example, our model relieves the scale drift issues of monocular-SLAM (Fig. 1), leading to high-quality metric scale dense mapping. The code is available at https://github.com/YvanYin/Metric3D.
研究の動機と目的
- 未確認のカメラモデルを含む多様なカメラモデルに対して、ファインチューニングなしでゼロショットで単一画像からの計測的3次元再構成を可能にすること。
- モノクローラ深度推定における焦点距離、センサーサイズ、ピクセル寸法の違いによる計測的曖昧性を解消すること。
- 複数のカメラタイプとシーンカテゴリをカバーする大規模かつ多様なデータセットに、1つのモデルをトレーニングすること。
- テストデータに対するスケールアライメントやファインチューニングを必要とせず、正確な計測的深度予測を達成すること。
- 計測的深度の監視によって、スケールドリフトを排除し、モノクローラSLAMなどの下流タスクを改善すること。
提案手法
- すべてのトレーニング画像を標準化されたカメラモデルにマップする標準化カメラ空間変換モジュールを導入し、多様なカメラ内部パrameterのばらつきを低減する。
- 変換の2つのバリエーションを適用:1つは画像の外観を標準化カメラの挙動に再現するもの、もう1つは教師深度ラベルの変換による監視のためのもの。
- 推論時において、標準化空間からの予測を元に、実世界の計測的深度を回復するために非標準化変換を適用する。
- ランダムなパッチ抽出に基づくスケール・シフト不変損失を提案し、局所的な幾何構造と分布に焦点を当てる。
- 11の多様なデータセット(屋内、屋外、自動走行シーンを含む)から得た800万枚の画像を用いてモデルをトレーニング。同定可能なカメラモデルは数万種類にのぼる。
- 既存のモノクローラ深度アーキテクチャに、アーキテクチャの変更なしにモジュールを統合可能で、広範な互換性を実現。
実験結果
リサーチクエスチョン
- RQ11つのモノクローラ深度モデルが、ファインチューニングなしに未確認のカメラモデルや実世界の計測的深度再構成に一般化可能か?
- RQ2焦点距離やセンサーサイズの違いによる計測的曖昧性を、トレーニング段階でどのように解消することで、ゼロショット計測的深度推定を可能にするか?
- RQ3大規模かつ多様なデータセットが、モノクローラ深度推定におけるゼロショット一般化性能をどの程度向上できるか?
- RQ4ネットワーク内にカメラモデルを暗黙的または明示的に埋め込む手法と比較して、提案された標準化カメラ空間変換が優れているか?
- RQ5計測的深度予測が、スケールドリフトを排除することで、モノクローラSLAMなどの下流タスクに顕著な改善をもたらすか?
主な発見
- Metric3Dは、スケールアライメントなしに、NYU、KITTI、DIODE、ETH3D、iBims-1、NuScenes、7Scenesの7つのゼロショットベンチマークで最先端の性能を達成。
- 第2回モノクローラ深度推定コンテストで優勝し、未確認のカメラ設定において優れた一般化性能と計測的正確性を示した。
- KITTIオドメトリーベンチマークでは、Droid-SLAMにMetric3Dを統合することで、スケールドリフトが完全に解消され、ファインチューニングなしに高品質な計測的密度マッピングが可能になった。
- Flickrの画像から、焦点距離とピクセルサイズのメタデータのみを用いて、合理的な実世界スケールの計測的3次元点群を再構成した。
- 視覚的比較では、Adabins、NewCRFs、Omnidataなどの最先端手法と比較して、はるかに少ないアーティファクトとより正確な深度予測が得られた。
- 焦点距離が異なる6リングカメラからの一貫性ある360°計測的再構成が可能であり、マルチビュー自動走行シナリオにおける高いロバスト性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。