Skip to main content
QUICK REVIEW

[論文レビュー] Recurrent MVSNet for High-resolution Multi-view Stereo Depth Inference

Yao Yao, Zixin Luo|arXiv (Cornell University)|Feb 27, 2019
Advanced Vision and Imaging参考文献 24被引用数 15
ひとこと要約

この論文では、マルチビューステレオ(MVS)再構築における3Dコストボリュームの正則化に、深さ方向に逐次処理する深度方向ゲート付き再帰ユニット(GRU)を用いた、再帰的ニューラルネットワークベースのフレームワークR-MVSNetを提案する。3D CNNの代わりにGRUを採用することで、コストマップを深さ方向に逐次処理し、メモリ消費量を立方体スケーリングから二次関数的スケーリングに削減し、従来の学習ベース手法では不可能だった高解像度・大規模MVS再構築を可能にする。

ABSTRACT

Deep learning has recently demonstrated its excellent performance for multi-view stereo (MVS). However, one major limitation of current learned MVS approaches is the scalability: the memory-consuming cost volume regularization makes the learned MVS hard to be applied to high-resolution scenes. In this paper, we introduce a scalable multi-view stereo framework based on the recurrent neural network. Instead of regularizing the entire 3D cost volume in one go, the proposed Recurrent Multi-view Stereo Network (R-MVSNet) sequentially regularizes the 2D cost maps along the depth direction via the gated recurrent unit (GRU). This reduces dramatically the memory consumption and makes high-resolution reconstruction feasible. We first show the state-of-the-art performance achieved by the proposed R-MVSNet on the recent MVS benchmarks. Then, we further demonstrate the scalability of the proposed method on several large-scale scenarios, where previous learned approaches often fail due to the memory constraint. Code is available at https://github.com/YoYo000/MVSNet.

研究の動機と目的

  • 深層学習ベースのMVS手法における3D CNNベースのコストボリューム正則化の高メモリ消費を解消すること。
  • モデル解像度に関して、メモリ複雑性を立方体から二次関数に低減させることで、スケーラブルかつ高解像度MVS再構築を可能にすること。
  • 従来の学習ベースMVS手法(例:MVSNet)と同等またはそれ以上の再構築品質を維持または向上させること。
  • 広い深度範囲を有する大規模シーンにおけるエンドツーエンド学習ベースMVSの実現可能性を示すこと。
  • 標準ベンチマークで性能を損なわせることなく、3D CNNの代替としてメモリ効率の良い手法を提供すること。

提案手法

  • MVSNetにおける3D CNNベースのコストボリューム正則化を、深さ次元に沿ってコストマップを逐次処理する畳み込み型ゲート付き再帰ユニット(GRU)に置き換える。
  • GRUを用いて、再帰的かつメモリ効率の良い方法で3Dコストボリューム全体にわたる空間的および深さ方向の文脈情報を集約する。
  • コストボリュームを深さ方向にスライスごとに処理することで、オンラインメモリ使用量をO(H×W×D³)からO(H×W×D²)に削減する。
  • MVSNetの微分可能なホモジニア図法を活用して、マルチビュー画像から初期コストボリュームを構築する。
  • 最終的なポイントクラウド品質を向上させるために、変動的リファインメント、光度フィルタリング、幾何的フィルタリング、深度マップ統合といった後処理ステップを適用する。
  • 固定入力サイズで標準MVSベンチマーク(DTU、Tanks and Temples、ETH3D)上でネットワークをエンドツーエンド学習し、微調整なしに任意の入力サイズに展開可能である。

実験結果

リサーチクエスチョン

  • RQ1再帰的アーキテクチャは、再構築品質を維持または向上させながら、3Dコストボリューム正則化におけるメモリ消費量を削減できるか?
  • RQ2GRUによる逐次処理は、高解像度MVSにおいて、3D CNNに比べてどの程度メモリ効率とスケーラビリティに優れているか?
  • RQ3提案手法は、従来の学習ベース手法がメモリ制限により処理できなかった、広い深度範囲を持つ大規模MVSシーンを処理できるか?
  • RQ4DTU、Tanks and Temples、ETH3Dといった標準ベンチマークにおいて、R-MVSNetの性能はMVSNetや他のベースラインと比べてどの程度か?
  • RQ5変動的リファインメントやフィルタリングなどの後処理コンポーネントは、提案フレームワークにおける最終的再構築品質にどのような影響を及えるか?

主な発見

  • R-MVSNetは、DTU、Tanks and Temples、ETH3Dベンチマークで最先端の性能を達成しており、元のMVSNetと同等またはそれ以上の結果を示している。
  • 解像度640×512×256のDTUデータセットにおいて、R-MVSNetはアブレーションスタディでベースラインの3D CNNベースMVSNetを上回るf_score 0.465を達成した。
  • モデル解像度に伴うランタイムメモリ使用量を立方体スケーリングから二次関数的スケーリングに削減したため、従来の学習ベースMVS手法の限界を超えた高解像度再構築が可能になった。
  • R-MVSNetは、従来の学習ベースアプローチがメモリ制限により処理できなかったTanks and Templesの高度なセットのような大規模シーンを正常に再構築できた。
  • 変動的リファインメントや光度フィルタリングなどの後処理コンポーネントは再構築品質を顕著に向上させ、f_scoreを統合なしの0.431からフルパイプラインの0.465にまで向上させた。
  • 微調整なしに異なるデータセットに良好に一般化でき、DTUでの学習のみでTanks and TemplesおよびETH3Dでも強力な性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。