Skip to main content
QUICK REVIEW

[論文レビュー] Fast-MVSNet: Sparse-to-Dense Multi-View Stereo With Learned Propagation and Gauss-Newton Refinement

Zehao Yu, Shenghua Gao|arXiv (Cornell University)|Mar 29, 2020
Advanced Vision and Imaging参考文献 44被引用数 14
ひとこと要約

Fast-MVSNetは、3次元畳み込みニューラルネットワーク(3D CNN)を用いて最初にスパースで高解像度の深度マップを予測し、その後、共同バイナリィルピーイングにインspiredされた学習可能な局所伝搬ネットワークによりそれを密度化し、最後に微分可能Gauss-Newton層を用いて結果を精緻化する、軽量で効率的なスパースから密度へのマルチビューステレオフレームワークを提案する。本手法は、DTUおよびTanks and Templesで最先端の精度を達成しているが、Point-MVSNetおよびR-MVSNetと比べてそれぞれ5倍および14倍高速であり、メモリ効率が良く、エンド・ツー・エンドで訓練可能な設計のおかげである。

ABSTRACT

Almost all previous deep learning-based multi-view stereo (MVS) approaches focus on improving reconstruction quality. Besides quality, efficiency is also a desirable feature for MVS in real scenarios. Towards this end, this paper presents a Fast-MVSNet, a novel sparse-to-dense coarse-to-fine framework, for fast and accurate depth estimation in MVS. Specifically, in our Fast-MVSNet, we first construct a sparse cost volume for learning a sparse and high-resolution depth map. Then we leverage a small-scale convolutional neural network to encode the depth dependencies for pixels within a local region to densify the sparse high-resolution depth map. At last, a simple but efficient Gauss-Newton layer is proposed to further optimize the depth map. On one hand, the high-resolution depth map, the data-adaptive propagation method and the Gauss-Newton layer jointly guarantee the effectiveness of our method. On the other hand, all modules in our Fast-MVSNet are lightweight and thus guarantee the efficiency of our approach. Besides, our approach is also memory-friendly because of the sparse depth representation. Extensive experimental results show that our method is 5$ imes$ and 14$ imes$ faster than Point-MVSNet and R-MVSNet, respectively, while achieving comparable or even better results on the challenging Tanks and Temples dataset as well as the DTU dataset. Code is available at https://github.com/svip-lab/FastMVSNet.

研究の動機と目的

  • 既存の深層学習ベースのMVS手法の非効率性、特に大きな3次元コストボリュームによる計算コストとメモリ使用量の高さを是正すること。
  • スパースから密度への、粗いから詳細へのフレームワークを活用することで、精度を損なわず再構築の効率を向上させること。
  • 軽量で微分可能なモジュールを設計し、エンド・ツー・エンドでの訓練を可能にするとともに、高解像度の深度ディテールを維持すること。
  • ロボット工学や拡張現実など、実用的応用分野における高解像度MVSのリアルタイム性能を達成すること。

提案手法

  • 複数視点画像の2次元畳み込みニューラルネットワーク(2D CNN)特徴量からスパースコストボリュームを構築し、3次元畳み込みニューラルネットワーク(3D CNN)を用いてスパースで高解像度の深度マップを予測する。
  • 小さなスケールの畳み込みネットワークが、局所的な画像領域内の深度依存関係を学習し、スパース深度値を伝搬させて深度マップを密度化する。これは、共同バイナリィルピーイングにインspiredされたものである。
  • 微分可能Gauss-Newton層を導入し、マルチビュー特徴量と粗い深度予測値を用いて密度化された深度マップを精緻化する。
  • 伝搬モジュールはデータに適応可能であり、局所的な深度一貫性をモデル化することで、深度密度化プロセスを説明可能である。
  • すべてのモジュールは軽量であり、エンド・ツー・エンドで訓練可能であり、スパース表現のおかげで効率的な推論とメモリ効率を実現している。
  • 深度統合は、光度フィルタリング、幾何的一致性のチェック、マルチビュー平均化を用いて実施され、最終的な再構築品質の向上が図られている。

実験結果

リサーチクエスチョン

  • RQ1スパースから密度への、粗いから詳細へのMVSフレームワークは、従来の3次元畳み込みニューラルネットワークベースの手法と比較して、顕著に推論速度とメモリ効率を向上させつつ、高い精度を達成できるか?
  • RQ2大きな3次元畳み込みを用いないで、学習可能な局所伝搬ネットワークがスパースで高解像度の深度マップを効果的に密度化できるか?
  • RQ3軽量でエンド・ツー・エンドのMVSパイプラインにおいて、微分可能なGauss-Newton精緻化層が深度マップの精度をどの程度向上させるか?
  • RQ4幾何的一致性のしきい値や可視ビュー数といったハイパーパrameterは、再構築における精度と完全性のトレードオフにどの程度影響を与えるか?

主な発見

  • Fast-MVSNetは、DTUデータセットにおいてPoint-MVSNetおよびR-MVSNetと比べてそれぞれ5倍および14倍の高速化を達成したが、同等またはより高い精度を維持している。
  • 大きな3次元コストボリュームを回避し、スパース表現を用いることで、メモリ消費量を削減し、高解像度のシーンに適している。
  • Gauss-Newton精緻化層のおかげで再構築精度が10%相対的に向上したが、1回の反復を超えてはほとんど向上しない。
  • 統合のハイパーパrameter(ηとV)は、精度と完全性のトレードオフに顕著な影響を与え、η=0.12およびV=3が最良の全体的性能を示した。
  • アブレーションスタディにより、Gauss-Newton層が極めて有効であることが確認され、1回の反復で性能が安定化するため、単一ステップ精緻化としての使用が正当化された。
  • DTUデータセットにおける再構築結果は、すべてのシーンで密度が高く、正確でノイズに強く、安定した3次元出力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。