Skip to main content
QUICK REVIEW

[論文レビュー] MonSter: Awakening the Mono in Stereo

Yotam Gil, Shay Elmalem|arXiv (Cornell University)|Oct 30, 2019
Advanced Vision and Imaging参考文献 38被引用数 6
ひとこと要約

MonSterは、位相符号化アパーチャーとディープラーニングベースのモノクロナルネットワークから得られるステレオ視差マップとモノクロナル深度マップを融合するハイブリッドステレオ・モノクロナル深度推定システムを提案する。2つの深度推定値の整合性を強制することで、オンライン自己キャリブレーションが可能となり、深度推定の相対的L1損失が10%削減され、広い深度範囲にわたり精度が向上する。

ABSTRACT

Passive depth estimation is among the most long-studied fields in computer vision. The most common methods for passive depth estimation are either a stereo or a monocular system. Using the former requires an accurate calibration process, and has a limited effective range. The latter, which does not require extrinsic calibration but generally achieves inferior depth accuracy, can be tuned to achieve better results in part of the depth range. In this work, we suggest combining the two frameworks. We propose a two-camera system, in which the cameras are used jointly to extract a stereo depth and individually to provide a monocular depth from each camera. The combination of these depth maps leads to more accurate depth estimation. Moreover, enforcing consistency between the extracted maps leads to a novel online self-calibration strategy. We present a prototype camera that demonstrates the benefits of the proposed combination, for both self-calibration and depth reconstruction in real-world scenes.

研究の動機と目的

  • ステレオビジョンの限界、たとえばキャリブレーションへの感受性や近距離深度推定における性能の低さを解消する。
  • モノクロナル深度推定に内在する深度の曖昧さとノイズを、ステレオデータと組み合わせることで克服する。
  • モノクロナル深度を一貫した基準として用いることで、ステレオカメラのオンライン自己キャリブレーションを可能にする。
  • ステレオとモノクロナル手法の相補的な強みを統合することで、深度推定の有効な深度範囲を拡張する。
  • シミュレートされたデータで訓練されたモデルが、微調整なしに実世界のシーンにうまく一般化できることを示す。

提案手法

  • 位相符号化アパーチャーを備えたカメラを1台搭載した2カメラステレオシステムを導入し、光学画像に深度の手がかりを埋め込む。
  • 畳み込みニューラルネットワーク(CNN)を訓練して、位相符号化画像から深度を抽出し、実世界の単位を用いた絶対深度推定を可能にする。
  • 変更のないステレオ画像を別個のモノクロナル深度ネットワーク(例:DPT)に供給し、相対的深度マップを生成する。
  • 微分可能な射影変換を適用して左画像を右画像に整合させ、ステレオマッチングを可能にする。
  • 4層の畳み込みネットワークを用いて、ステレオとモノクロナル深度マップを統合し、精度向上に寄与する最適なピクセル単位の重み付けを学習する。
  • トレーニング中にステレオとモノクロナル深度マップの整合性を強制することで、外部キャリブレーションパターンを用いずにオンライン自己キャリブレーションを実現する。

実験結果

リサーチクエスチョン

  • RQ1外部キャリブレーションパターンを用いずに、モノクロナル深度推定を活用してステレオカメラのオンライン自己キャリブレーションを可能にすることができるか?
  • RQ2ステレオとモノクロナル深度マップを統合することで、さまざまな深度範囲における深度推定精度がどのように向上するか?
  • RQ3位相符号化アパーチャー法は、近距離シーンにおけるモノクロナル深度精度をどの程度向上させるか?
  • RQ4シミュレーションデータで訓練されたシステムは、微調整なしに実世界の深度推定にうまく一般化できるか?
  • RQ5ステレオとモノクロナル深度マップの統合により、それぞれの方法の固有の弱み(たとえば、ステレオの近距離エラーとモノクロナルの遠距離ノイズ)が緩和されるか?

主な発見

  • 融合された深度マップは、シミュレートされたデータ(真値あり)において、ステレオ単体推定と比較して相対的L1損失が10%改善された。
  • 近距離(深度 < 1m)ではモノクロナル手法がステレオを上回り、相対的L1損失が0.551(モノクロナル)対0.071(ステレオ)であり、ステレオの近距離深度推定における限界が示された。
  • モノクロナル手法は近距離領域(マスク処理済み領域)においても優れた性能(損失0.119)を示した一方、ステレオは中距離~遠距離で優位であった。
  • ステレオとモノクロナル深度マップの整合性を強制することで、外部キャリブレーションパターンを必要としないオンライン自己キャリブレーションが実現された。
  • プロトタイプは実世界のシーンにおいて定性的な改善を示し、オクルージョンや大きな視差のためステレオ単体で見逃していた近距離の物体(例:スプレー容器)の深度詳細を正確に捉えていた。
  • モデルは合成データで訓練されたにもかかわらず、実世界データへの一般化が良好であり、実画像への微調整なしに優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。