Skip to main content
QUICK REVIEW

[論文レビュー] Towards 3D Scene Reconstruction from Locally Scale-Aligned Monocular Video Depth

Guangkai Xu, Wei Yin|arXiv (Cornell University)|Feb 3, 2022
Advanced Vision and Imaging被引用数 6
ひとこと要約

本論文では、単眼動画深度推定におけるスケールおよびシフトの回復に局所加重線形回帰法を提案し、フレーム間でスケールの一貫性を確保する。スパースなアンカーポイントと630万枚のRGBD画像を用いた学習により、ゼロショットベンチマークで最先端手法を最大50%向上させ、各フレームの予測を用いて正確な3次元シーン再構築を実現する。

ABSTRACT

Existing monocular depth estimation methods have achieved excellent robustness in diverse scenes, but they can only retrieve affine-invariant depth, up to an unknown scale and shift. However, in some video-based scenarios such as video depth estimation and 3D scene reconstruction from a video, the unknown scale and shift residing in per-frame prediction may cause the depth inconsistency. To solve this problem, we propose a locally weighted linear regression method to recover the scale and shift with very sparse anchor points, which ensures the scale consistency along consecutive frames. Extensive experiments show that our method can boost the performance of existing state-of-the-art approaches by 50% at most over several zero-shot benchmarks. Besides, we merge over 6.3 million RGBD images to train strong and robust depth models. Our produced ResNet50-backbone model even outperforms the state-of-the-art DPT ViT-Large model. Combining with geometry-based reconstruction methods, we formulate a new dense 3D scene reconstruction pipeline, which benefits from both the scale consistency of sparse points and the robustness of monocular methods. By performing the simple per-frame prediction over a video, the accurate 3D scene shape can be recovered.

研究の動機と目的

  • 単眼深度推定におけるフレーム間のスケールおよびシフトの一貫性の欠如を是正すること。
  • 単眼動画からの3次元シーン再構築の頑健性と正確性を向上させること。
  • スケール一貫性を持つスパースな点と単眼深度モデルを組み合わせたスケーラブルなパイプラインを開発すること。
  • 630万枚のRGBD画像を用いて強力な深度モデルを学習し、一般化性能を向上させること。

提案手法

  • 連続する動画フレーム間で非常にスパースなアンカーポイントからスケールおよびシフトを推定するために、局所加重線形回帰手法を用いる。
  • これらのスパースなアンカーポイントを用いて深度予測をフレーム間で整合させることで、スケールの一貫性を強制する。
  • ResNet50バックボーンを備えた頑健な深度モデルを事前学習するため、630万枚を超えるRGBD画像の大規模データセットを構築する。
  • 学習済み深度モデルを幾何学的再構築手法と組み合わせ、密度の高い3次元シーンを生成する。
  • 各フレームの単眼深度予測を入力とし、提案された回帰手法を用いてスケール補正を施す。
  • 最終的なパイプラインは、明示的なマルチビュー幾何学的構造や明示的な深度監視を必要とせずに、正確な3次元再構築を可能にする。

実験結果

リサーチクエスチョン

  • RQ1連続するフレーム間で単眼動画深度推定におけるスケールおよびシフトの不一致を効果的に是正する方法は何か?
  • RQ2スケールの一貫性は、単眼動画からの3次元シーン再構築の正確性をどの程度向上させるか?
  • RQ3大規模なRGBDデータセットは、単眼深度モデルの頑健性を顕著に向上させ得るか?
  • RQ4提案手法は、ファインチューニングなしでゼロショットベンチマークにおいて最先端手法を上回るか?
  • RQ5単純な各フレーム予測パイプラインにスケール補正を組み合わせることで、高精細な3次元再構築が達成可能か?

主な発見

  • 提案手法は、ゼロショットベンチマークで既存の最先端深度推定モデルの性能を最大50%向上させる。
  • 630万枚のRGBD画像を用いて学習したResNet50バックボーンモデルは、最先端のDPT ViT-Largeモデルを上回る性能を示す。
  • スパースなアンカーポイントを用いたスケールの一貫性が、3次元シーン再構築の品質を顕著に向上させる。
  • 本手法は、各フレームの単眼深度予測のみを用いても、正確な密度の高い3次元再構築を実現できる。
  • 本パイプラインは多様なシーンにおいても頑健性を維持しながら、高い幾何学的忠実性を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。