Skip to main content
QUICK REVIEW

[論文レビュー] MVSTER: Epipolar Transformer for Efficient Multi-View Stereo

Xiaofeng Wang, Zheng Zhu|arXiv (Cornell University)|Apr 15, 2022
Advanced Vision and Imaging被引用数 9
ひとこと要約

MVSTERは、エピポーラ線に沿った2次元の意味特徴と3次元空間相関を同時にモデル化するエピポーラトランスフォーマーを用いた、効率的なマルチビュー・ステレオ手法を提案する。これにより、追加のネットワークの必要がなくなる。DTUとTanks&Templesのベンチマークにおいて、それぞれ34%および14%の相対的精度向上を達成するとともに、MVSNetおよびCasMVSNetと比較して推論時間を80%および51%短縮した。

ABSTRACT

Learning-based Multi-View Stereo (MVS) methods warp source images into the reference camera frustum to form 3D volumes, which are fused as a cost volume to be regularized by subsequent networks. The fusing step plays a vital role in bridging 2D semantics and 3D spatial associations. However, previous methods utilize extra networks to learn 2D information as fusing cues, underusing 3D spatial correlations and bringing additional computation costs. Therefore, we present MVSTER, which leverages the proposed epipolar Transformer to learn both 2D semantics and 3D spatial associations efficiently. Specifically, the epipolar Transformer utilizes a detachable monocular depth estimator to enhance 2D semantics and uses cross-attention to construct data-dependent 3D associations along epipolar line. Additionally, MVSTER is built in a cascade structure, where entropy-regularized optimal transport is leveraged to propagate finer depth estimations in each stage. Extensive experiments show MVSTER achieves state-of-the-art reconstruction performance with significantly higher efficiency: Compared with MVSNet and CasMVSNet, our MVSTER achieves 34% and 14% relative improvements on the DTU benchmark, with 80% and 51% relative reductions in running time. MVSTER also ranks first on Tanks&Temples-Advanced among all published works. Code is released at https://github.com/JeffWang987.

研究の動機と目的

  • 特徴統合に追加のネットワークに依存する既存の学習ベースのMVS手法における非効率性と3次元一般化能力の限界を解消すること。
  • 追加の可学習パラメータを導入せずに、エピポーラ線に沿った3次元空間相関を活用すること。
  • 段階的なフレームワーク内でモノクロナル深度の監督とマルチビュー・ステレオを共同最適化することで、深度推定精度を向上させること。
  • 効率的なアテンション機構とエントロピー正則化最適輸送を用いて、計算コストを低減しながら再構築品質を維持または向上させること。

提案手法

  • エピポーラトランスフォーマーは、クロスアテンションを用いてエピポーラ線に沿ったデータ依存の3次元関連性をモデル化し、参照カメラの視準拡大内に投影された複数視点からの特徴を活用する。
  • 補助的なモノクロナル深度推定器が訓練中に2次元特徴の意味的表現を強化し、訓練後には分離されて実行時オーバーヘッドを回避する。
  • 深度推定を深さに敏感な分類問題として定式化し、エントロピー正則化最適輸送を用いて段階的なパイプラインでより細かい深度マップを伝搬する。
  • エントロピー正則化最適輸送を組み込んだ段階的構造により、最小限の計算コストで深度予測の段階的精錬が可能となり、精度が向上する。
  • FLOPsを低減しながら特徴表現能力を維持するため、$3\times3\times1$畳み込みを用いた軽量な3次元CNNを採用する。
  • マルチビュー特徴の統合は、従来の分散ベースや重み付き統合に代わり、アテンション駆動で幾何学に配慮した集約を実現するエピポーラトランスフォーマーによって行われる。

実験結果

リサーチクエスチョン

  • RQ1MVSにおいて、パラメータ効率の良いアテンション機構を用いて、エピポーラ線に沿った3次元空間相関を効果的にモデル化できるか?
  • RQ2追加の実行時コストを負担せずに、補助的なモノクロナル深度監視が2次元特徴の意味的表現を向上させられるか?
  • RQ3エントロピー正則化最適輸送は、段階的MVSパイプラインにおいてより正確で細粒度の高い深度推定を可能にするか?
  • RQ4提案手法は、既存のMVSネットワークと比較して、顕著に短い推論時間でSOTA性能を達成できるか?

主な発見

  • MVSTERは、MVSNetと比較してDTUベンチマークで34%の相対的精度向上を達成し、実行時間を80%短縮した。
  • 同じベンチマークにおいて、CasMVSNetと比較して14%の相対的精度向上を達成するとともに、推論時間を51%短縮した。
  • Tanks&Temples-Advancedベンチマークでは、発表済みのすべての手法の中で第1位を獲得し、優れた一般化性能とロバストネスを示した。
  • MVSTERは、MVSNetおよびCasMVSNetと比較して、深度仮説の数をそれぞれ88%および73%削減し、大幅な効率向上を実現した。
  • アブレーションスタディにより、温度パラメータ$t_e = 2$および損失重み$\lambda = 3 \times 10^{-4}$がDTUで最適な性能を発揮することが確認された。
  • DTU、ETH3D、Tanks&Templesにおける点群可視化結果から、MVSTERは多様なシーンや深度範囲にわたり、高品質で詳細な再構築を生成することがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。