Skip to main content
QUICK REVIEW

[論文レビュー] TransMVSNet: Global Context-aware Multi-view Stereo Network with Transformers

Yikang Ding, Wentao Yuan|arXiv (Cornell University)|Nov 29, 2021
Advanced Vision and Imaging被引用数 13
ひとこと要約

TransMVSNet は、自己注意およびクロス注意メカニズムを用いて、視点内および視点間で長距離のグローバルコンテキストを捉える特徴マッチングトランスフォーマー(FMT)を活用する、エンドツーエンドのマルチビューステレオネットワークを提案する。アダプティブリセプティブフィールド(ARF)モジュールと変換された特徴パスを統合することで、効果的な特徴の最適化と勾配の流れを実現し、DTU、Tanks and Temples、BlendedMVSベンチマークで最先端の性能を達成した。BlendedMVSでは0.73のEPEを達成した。

ABSTRACT

In this paper, we present TransMVSNet, based on our exploration of feature matching in multi-view stereo (MVS). We analogize MVS back to its nature of a feature matching task and therefore propose a powerful Feature Matching Transformer (FMT) to leverage intra- (self-) and inter- (cross-) attention to aggregate long-range context information within and across images. To facilitate a better adaptation of the FMT, we leverage an Adaptive Receptive Field (ARF) module to ensure a smooth transit in scopes of features and bridge different stages with a feature pathway to pass transformed features and gradients across different scales. In addition, we apply pair-wise feature correlation to measure similarity between features, and adopt ambiguity-reducing focal loss to strengthen the supervision. To the best of our knowledge, TransMVSNet is the first attempt to leverage Transformer into the task of MVS. As a result, our method achieves state-of-the-art performance on DTU dataset, Tanks and Temples benchmark, and BlendedMVS dataset. The code of our method will be made available at https://github.com/MegviiRobot/TransMVSNet .

研究の動機と目的

  • テクスチャが欠落している、または繰り返しのある領域における頑健な深度推定を妨げる、MVSにおける局所的特徴表現の限界を解消すること。
  • 画像内および画像間の長距離グローバルコンテキストを明示的にモデル化することで、マルチビューステレオにおける特徴マッチングを改善すること。
  • 効果的な監視とメモリ効率を備えた、トランスフォーマーに基づくMVSネットワークのエンドツーエンド学習を可能にすること。
  • 標準的な画像マッチングタスクとは異なり、MVSの1対多のマッチング特性に適応するためのトランスフォーマーの挑戦を克服すること。

提案手法

  • 各画像内でグローバルコンテキストを統合するためのイントラアテンションと、すべてのソース画像間でクロスビュー対応関係をモデル化するためのインターアテンションを用いる特徴マッチングトランスフォーマー(FMT)を提案する。
  • 局所的に集約されたCNN特徴からグローバルに受容場の広がったFMT特徴へ滑らかに移行するためのアダプティブリセプティブフィールド(ARF)モジュールを導入し、スケール間での特徴の一貫性を保証する。
  • 中間特徴と勾配を異なる解像度段階を跨いで伝達する変換された特徴パスを採用し、粗いから細かい段階への効率的な最適化を実現する。
  • 参照画像とソース画像の特徴マップ間のマッチングコストを計算するためにペアワイズ特徴相関を用いることで、対応関係推定を強化する。
  • 特に曖昧または困難な領域において、予測が難しいピクセルに対する監視を向上させるために、あいまいさ低減型フォーカル損失を適用する。
  • 複数段階の深度予測と段階的な深度仮説の最適化を組み合わせた粗いから細かい段階への正則化戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマーに基づくアーキテクチャは、マルチビューステレオマッチングにおいて長距離グローバルコンテキストを効果的にモデル化できるか? これにより、困難な領域における深度推定が向上するか?
  • RQ2トランスフォーマーの自己注意およびクロス注意メカニズムは、標準的な画像マッチングとは異なり、MVSの1対多のマッチング特性にどのように適応できるか?
  • RQ3高い効率性と低いメモリオーバーヘッドを実現するための、トランスフォーマーに基づくMVSネットワークのエンドツーエンド学習を可能にするために必要なアーキテクチャ的要素は何か?
  • RQ4FMTによるグローバルコンテキストの統合は、標準的なMVSベンチマークにおける深度精度および完全性に測定可能な向上をもたらすか?

主な発見

  • TransMVSNet は BlendedMVS の検証セットで 0.73 の平均誤差(EPE)を達成し、CasMVSNet(1.43 EPE) や EPP-MVSNet(1.17 EPE) といった先行手法を顕著に上回った。
  • DTU データセットでは、EPE が 0.73 に達し、ベースラインの CasMVSNet(1.43 EPE) に対して相対的に 48% の改善を達成し、このベンチマークで新たなSOTAを樹立した。
  • Tanks and Temples ベンチマークでは、最先端の性能を達成し、複雑で現実世界のシーンへの強い汎化能力を示した。
  • アブレーションスタディの結果、フォーカル損失、FMT、ARF、変換された特徴パスの各モジュールが性能向上に顕著な貢献をしていることが確認され、フルモデルではDTUで全体の精度が0.305に達した。
  • ARFモジュールは計算コストを増加させるが、より良い特徴適応を可能にした。一方、変換されたパスは最小限のメモリオーバーヘッドで性能向上を実現した。
  • ベースラインモデルと比較して1.4倍の推論速度低下が生じたが、フルモデルは1枚あたり1秒未満で実行可能であり、実世界応用において実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。