Skip to main content
QUICK REVIEW

[論文レビュー] CamLessMonoDepth: Monocular Depth Estimation with Unknown Camera Parameters

Sai Shyam Chanduri, Zeeshan Khan Suri|arXiv (Cornell University)|Oct 27, 2021
Advanced Vision and Imaging被引用数 5
ひとこと要約

この論文では、自己教師ありの単眼深度推定手法であるCamLessMonoDepthを提案する。本手法は、キャリブレーション済みでない画像系列から、ピンホールカメラの内部パrameterを暗黙的に学習することで、深度とポーズを同時に推定する。高解像度の深度マップ作成には、効率的なサブピクセル畳み込みを用い、ピクセル単位の不確実性推定も実装している。本手法は、真値のカメラパrameterを必要とせず、多様なインターネット動画を用いた学習が可能であり、KITTIベンチマークで最先端の性能を達成している。

ABSTRACT

Perceiving 3D information is of paramount importance in many applications of computer vision. Recent advances in monocular depth estimation have shown that gaining such knowledge from a single camera input is possible by training deep neural networks to predict inverse depth and pose, without the necessity of ground truth data. The majority of such approaches, however, require camera parameters to be fed explicitly during training. As a result, image sequences from wild cannot be used during training. While there exist methods which also predict camera intrinsics, their performance is not on par with novel methods taking camera parameters as input. In this work, we propose a method for implicit estimation of pinhole camera intrinsics along with depth and pose, by learning from monocular image sequences alone. In addition, by utilizing efficient sub-pixel convolutions, we show that high fidelity depth estimates can be obtained. We also embed pixel-wise uncertainty estimation into the framework, to emphasize the possible applicability of this work in practical domain. Finally, we demonstrate the possibility of accurate prediction of depth information without prior knowledge of camera intrinsics, while outperforming the existing state-of-the-art approaches on KITTI benchmark.

研究の動機と目的

  • 既存の自己教師あり手法の主な制限要因である、事前にキャリブレーションされたカメラパラメータを必要としない単眼深度推定を可能にすること。
  • 単眼画像系列からカメラ内部パラメータを暗黙的に学習し、真値のキャリブレーションデータの必要性を回避すること。
  • デコーダーにおける効率的なサブピクセル畳み込みベースのアップサンプリングにより、深度マップの品質を向上させること。
  • 自律走行などの実世界の応用における耐障害性を高めるために、ピクセル単位の不確実性推定を統合すること。
  • インターネット動画など、多様でキャリブレーションされていないデータへの汎用性を示すこと、特にカメラの高さや解像度、天候状況が異なる動画に対しても有効であること。

提案手法

  • 本手法は、単眼動画系列に基づく自己教師あり学習フレームワークを採用し、深層畳み込みニューラルネットワークを用いて、深度、ポーズ、カメラ内部パラメータを同時に予測する。
  • 再投影誤差を最小化する損失関数とオートマスク技術を用い、オクルージョンや静止ピクセルに対処することで、動的シーンにおける耐障害性を向上させる。
  • 深度デコーダーに効率的なサブピクセル畳み込みネットワーク(ESPCN)を適用し、特徴マップのアップサンプリングを実現することで、よりシャープで高解像度の深度予測を生成する。
  • 異分散的アレアトリック不確実性推定をモデルに組み込み、各ピクセルごとの信頼性を予測することで、意思決定タスクにおける信頼性を向上させる。
  • カメラ内部パラメータはネットワーク全体のエンドツーエンド学習により予測され、明示的な入力としてのキャリブレーションパラメータの必要性がなくなる。
  • 学習パイプラインは、KITTI 2015データに加え、57本のレーンシーン動画から得た7,623枚のインターネット由来画像を組み合わせており、多様なデータへの頑健な汎用性を実現している。

実験結果

リサーチクエスチョン

  • RQ1真値のカメラ内部パラメータが一切ない状態でも、単眼深度推定を正確に行うことができるか?
  • RQ2自己教師あり学習によってカメラパラメータを暗黙的に学習することで、実世界のキャリブレーションされていないデータへの汎用性が向上するか?
  • RQ3標準的な補間法と比較して、効率的なサブピクセル畳み込みが、深度マップの解像度とシャープネスを著しく向上させられるか?
  • RQ4ピクセル単位の不確実性推定は、実世界の展開環境におけるモデルの信頼性を向上させるか?
  • RQ5真値の監視情報やオンラインリファインメントを一切使用しない状態でも、KITTIで最先端の性能を達成できるか?

主な発見

  • 本モデルは、真値のカメラ内部パラメータを必要としない自己教師あり単眼深度推定において、KITTIベンチマークで最先端の性能を達成している。
  • デコーダーにESPCNを用いることで、特に高解像度領域において顕著にシャープな深度マップが得られ、標準的な補間法を上回る性能を示している。
  • 未観測のデータ、特にカメラの高さや解像度、天候状況が異なるインターネット動画に対しても、良好な汎用性を示している。
  • 定性的な結果から、ベースラインのMonoDepth2と比較して、境界や細い物体の再構成が顕著に優れている。
  • 不確実性推定の導入は深度精度を著しく向上させないが、後続タスクにおける信頼性の高い情報として価値がある。
  • 入力解像度が1024×320の際に最良の性能が得られ、オンラインリファインメントや真値データを使用しない他の最先端の自己教師あり手法を上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。