Skip to main content
QUICK REVIEW

[論文レビュー] DDR-Net: Learning Multi-Stage Multi-View Stereo With Dynamic Depth Range

Puyuan Yi, Shengkun Tang|arXiv (Cornell University)|Mar 26, 2021
Advanced Vision and Imaging参考文献 34被引用数 6
ひとこと要約

DDR-Netは、過去の予測からの不確実性に基づいて画素ごとに動的深度範囲仮説を適応的に決定する動的深度範囲推定モジュール(REM)を提案し、マルチステージマルチビューステレオの精度を向上させている。新たな損失戦略を活用して深度範囲を精緻化し、真値カバレッジを保証することで、計算コストの増加を最小限に抑えつつ、DTUベンチマークで最先端の性能を達成し、従来手法よりも高い精度と完全性を実現した。

ABSTRACT

To obtain high-resolution depth maps, some previous learning-based multi-view stereo methods build a cost volume pyramid in a coarse-to-fine manner. These approaches leverage fixed depth range hypotheses to construct cascaded plane sweep volumes. However, it is inappropriate to set identical range hypotheses for each pixel since the uncertainties of previous per-pixel depth predictions are spatially varying. Distinct from these approaches, we propose a Dynamic Depth Range Network (DDR-Net) to determine the depth range hypotheses dynamically by applying a range estimation module (REM) to learn the uncertainties of range hypotheses in the former stages. Specifically, in our DDR-Net, we first build an initial depth map at the coarsest resolution of an image across the entire depth range. Then the range estimation module (REM) leverages the probability distribution information of the initial depth to estimate the depth range hypotheses dynamically for the following stages. Moreover, we develop a novel loss strategy, which utilizes learned dynamic depth ranges to generate refined depth maps, to keep the ground truth value of each pixel covered in the range hypotheses of the next stage. Extensive experimental results show that our method achieves superior performance over other state-of-the-art methods on the DTU benchmark and obtains comparable results on the Tanks and Temples benchmark. The code is available at https://github.com/Tangshengku/DDR-Net.

研究の動機と目的

  • 粗〜細かいMVSネットワークにおける固定深度範囲仮説の制限を解消すること。これは、空間的に変化する深度予測の不確実性に適応できないためである。
  • 画素ごとの不確実性を反映する動的深度範囲を推定することで、深度マップの精度と完全性を向上させること。
  • 大受容 field を用いてグローバルな文脈から不確実性を捉えることができる範囲推定モジュール(REM)を設計すること。
  • 新たな損失戦略を開発し、深度範囲仮説を精緻化するとともに、以降の段階においても真値深度値がカバーされるように保証すること。
  • 計算コストの増加を最小限に抑えつつ、特にDTUにおいて標準MVSベンチマークで最先端の性能を達成すること。

提案手法

  • 複数段階のMVSフレームワークを採用し、範囲推定モジュール(REM)を最初の2段階に適用して画素ごとの動的深度範囲を予測する。
  • REMは、隣接画素からの不確実性情報を集約できる、大受容 field を持つ浅い2次元畳み込みニューラルネットワーク(CNN)である。
  • 初期深度マップは固定深度範囲を用いて最も粗い解像度で生成され、その後REMによって段階ごとの動的深度仮説に精緻化される。
  • 新たな損失戦略により、前段階の確率分布が新たにサンプリングされた動的深度範囲にクランプされ、ソフトアーグミンを用いた精緻な深度マップ回帰が可能になる。
  • 精緻化された深度マップをREMの教師信号として用いることで、以降の段階における深度範囲予測の信頼性と精度が向上する。
  • 最終段階では、2段階目の動的範囲を用いて高解像度の深度マップを生成するが、以降の精緻化は一切施されない。

実験結果

リサーチクエスチョン

  • RQ1固定範囲法と比較して、動的深度範囲推定はマルチビューステレオ再構築の精度と完全性を向上させることができるか?
  • RQ2画素ごとの深度予測における不確実性を効果的にモデル化し、段階ごとの深度範囲選択を支援する方法は何か?
  • RQ3真値カバレッジを動的深度範囲に強制する損失戦略は、より優れた深度マップ品質をもたらすか?
  • RQ4軽量で浅いネットワーク(REM)は、グローバルな文脈を捉え、下流の性能を向上させることができるか?
  • RQ5標準ベンチマークにおいて、提案手法は最先端のMVS手法と比較して、精度、完全性、効率性の観点でどのように差をつけるか?

主な発見

  • DDR-NetはDTUベンチマークで最先端の性能を達成し、全体スコア0.329を記録。ベースラインのCasMVSNet(0.348)およびUCSNet(0.342)を上回った。
  • REMと新たな損失戦略を併用したモデルでは、第3段階の平均深度範囲が20.91mmから19.24mmに7.9%減少し、真値カバレッジは83.91%から84.35%に向上した。
  • REM単体でも、ベースラインと比較して完全性が0.010、全体スコアが0.009向上し、その有効性が裏付けられた。
  • フルモデル(REM + 損失)では、第2段階で推定された深度範囲が真値をカバーするピクセルの割合が73.1%に達し、カバレッジ効率でUCSNet(59.8%)を大きく上回った。
  • 第1〜3段階でそれぞれ48、32、8個の深度平面しか使用しなかったが、高い精度を維持した。これは、性能向上がサンプリング数の増加によるものではなく、動的範囲推定によるものであることを示している。
  • 定性的な結果では、テクスチャが乏しく、反射性の高い領域でも、最先端手法と比較して優れた点群再構築品質を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。