Skip to main content
QUICK REVIEW

[論文レビュー] Attention Aware Cost Volume Pyramid Based Multi-view Stereo Network for 3D Reconstruction

Anzhu Yu, Wenyue Guo|arXiv (Cornell University)|Nov 25, 2020
Advanced Vision and Imaging参考文献 54被引用数 4
ひとこと要約

本論文では、特徴抽出および類似度ベースのコストボリューム構築に自己注意モジュールを用いる、粗大から細かい段階的なマルチビューステレオネットワークAACVP-MVSNetを提案する。複数スケールで深さマップを繰り返し精錬し、探索範囲を低減することで、DTUおよびBlendedMVSベンチマークで最先端の性能を達成し、最適設定下でDTUでの平均精度が0.326mmに達する。

ABSTRACT

We present an efficient multi-view stereo (MVS) network for 3D reconstruction from multiview images. While previous learning based reconstruction approaches performed quite well, most of them estimate depth maps at a fixed resolution using plane sweep volumes with a fixed depth hypothesis at each plane, which requires densely sampled planes for desired accuracy and therefore is difficult to achieve high resolution depth maps. In this paper we introduce a coarseto-fine depth inference strategy to achieve high resolution depth. This strategy estimates the depth map at coarsest level, while the depth maps at finer levels are considered as the upsampled depth map from previous level with pixel-wise depth residual. Thus, we narrow the depth searching range with priori information from previous level and construct new cost volumes from the pixel-wise depth residual to perform depth map refinement. Then the final depth map could be achieved iteratively since all the parameters are shared between different levels. At each level, the self-attention layer is introduced to the feature extraction block for capturing the long range dependencies for depth inference task, and the cost volume is generated using similarity measurement instead of the variance based methods used in previous work. Experiments were conducted on both the DTU benchmark dataset and recently released BlendedMVS dataset. The results demonstrated that our model could outperform most state-of-the-arts (SOTA) methods. The codebase of this project is at https://github.com/ArthasMil/AACVP-MVSNet.

研究の動機と目的

  • 既存の学習ベースのMVS手法における固定解像度の深さ推定の限界、特に高メモリ使用量と解像度制限を是正すること。
  • 事前の深さ推定を活用して探索範囲を狭めることで、深さマップの精度と解像度を向上させる粗大から細かい推論戦略の導入。
  • 特徴抽出ブロックに自己注意モジュールを統合することで、深さ推定のための特徴表現を強化すること。
  • 分散に基づくコストボリューム計算を類似度測定アプローチに置き換えることで、より頑健なコストボリューム構築を実現すること。
  • 複数スケールにわたるエンドツーエンドでパラメータを共有する深さ精錬を実現し、効率性と一貫性を確保すること。

提案手法

  • 粗大から細かい深さ推論戦略を採用し、各細かいレベルで前のレベルからのアップサンプリングとピクセル単位の深さ残差精錬を適用する。
  • マルチビュー画像全体にわたる長距離依存性を捉えるために、特徴抽出ブロックに自己注意層を統合する。
  • 分散に基づく手法の代わりに類似度ベースのコストボリュームを構築し、テクスチャが乏しいまたは反射的な領域に対しても頑健性を向上させる。
  • 各レベルで前のレベルの深さ残差を用いてコストボリュームを再計算することで、深さ探索空間を縮小し、精錬精度を向上させる。
  • すべてのネットワークパラメータをレベル間で共有することで、再トレーニングなしに効率的かつ反復的な深さマップ精錬を実現する。
  • DTUおよびBlendedMVSデータセットで真値深さマップを用いた教師あり学習により、エンドツーエンドでネットワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1深さ残差精錬を伴う粗大から細かい戦略は、マルチビューステレオにおける高解像度深さマップ推定を改善できるか?
  • RQ2特徴抽出に自己注意を統合することで、特に低テクスチャ領域において深さ推定性能が向上するか?
  • RQ3類似度ベースのコストボリューム構築は、従来の分散ベース手法に比べ、精度と頑健性の面で優れているか?
  • RQ4学習ベースのMVSフレームワークにおいて、入力ビュー数の増加が最終的な再構成品質に与える影響は何か?
  • RQ5提案手法は、DTUやBlendedMVSといった標準MVSベンチマークで最先端の性能を達成できるか?

主な発見

  • 提案されたAACVP-MVSNetは、DTUベンチマークで0.326mmの平均精度を達成し、本データセットで報告された最高の結果である。
  • モデルはDTUおよびBlendedMVS両データセットで、多数の最先端手法を上回り、優れた再構成精度と完全性を示している。
  • 7つのトレーニングビューと5つの評価ビューを用いることで最良の全体的性能が得られ、完全性スコアは0.299mm、平均精度は0.326mmであった。
  • 異なるトレーニング設定において、40エポック目で安定的に収束することが確認され、信頼性の高い一貫性のあるトレーニング行動を示している。
  • アブレーションスタディにより、自己注意と類似度ベースのコストボリュームがベースライン設定に比べて顕著に性能向上をもたらすことが確認された。
  • 粗大から細かい戦略により、細かいレベルでの深さ探索空間が効果的に縮小され、過度なメモリ消費を伴わずに高解像度の深さ推定が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。