Skip to main content
QUICK REVIEW

[論文レビュー] Learning Inverse Depth Regression for Multi-View Stereo with Correlation Cost Volume

Qingshan Xu, Wenbing Tao|arXiv (Cornell University)|Dec 26, 2019
Advanced Vision and Imaging参考文献 24被引用数 6
ひとこと要約

本稿では、平均群別相関に基づく軽量な相関コストボリュームを用いてメモリと計算量を削減するとともに、逆深度回帰による逆投影精度とスケーラビリティを実現する、新しいマルチビューステレオ手法CIDERを提案する。本手法は、DTUおよびTanks and Templesベンチマークで最先端の性能を達成し、大規模なシーンや曖昧な領域においてもより高いロバスト性を示す。

ABSTRACT

Deep learning has shown to be effective for depth inference in multi-view stereo (MVS). However, the scalability and accuracy still remain an open problem in this domain. This can be attributed to the memory-consuming cost volume representation and inappropriate depth inference. Inspired by the group-wise correlation in stereo matching, we propose an average group-wise correlation similarity measure to construct a lightweight cost volume. This can not only reduce the memory consumption but also reduce the computational burden in the cost volume filtering. Based on our effective cost volume representation, we propose a cascade 3D U-Net module to regularize the cost volume to further boost the performance. Unlike the previous methods that treat multi-view depth inference as a depth regression problem or an inverse depth classification problem, we recast multi-view depth inference as an inverse depth regression task. This allows our network to achieve sub-pixel estimation and be applicable to large-scale scenes. Through extensive experiments on DTU dataset and Tanks and Temples dataset, we show that our proposed network with Correlation cost volume and Inverse DEpth Regression (CIDER), achieves state-of-the-art results, demonstrating its superior performance on scalability and accuracy.

研究の動機と目的

  • マルチビューステレオ(MVS)における従来の3Dコストボリューム表現の高いメモリと計算コストを軽減すること。
  • テクスチャが欠如した領域や反射面などの困難な領域における深度推定精度の向上。
  • 大規模な3D再構築シナリオにおけるロバストなサブピクセル深度推定の実現。
  • 事後処理のリファインメント(例:変分リファインメントやCRF)への依存を減らすために、ネットワーク内での深度回帰戦略の改善。
  • 任意の数のソース画像をサポートするスケーラブルで軽量なコストボリュームの開発。

提案手法

  • 参照画像とソース画像間のコンactで軽量なコストボリューム特徴を計算するために、平均群別相関類似度測定を提案する。
  • 微分可能ワーピングモジュールを用いて視点間で特徴を投影し、グループ化された相関を用いて類似度スコアを計算する。
  • すべてのソース画像の類似度スコアを平均化することで統一されたコストボリュームを構築し、マルチビューのコンテキストを効率的に集約可能にする。
  • 段階的な3D U-Netアーキテクチャを導入し、コストボリュームを段階的に正則化し、曖昧な領域におけるノイズを低減する。
  • 深度推定を逆深度回帰に再定式化する:深度の仮説は逆深度空間で一様にサンプリングされ、ネットワークはサブピクセルの順序値を回帰して正確な深度予測を実現する。
  • 予測された順序値を元に戻して最終的な深度に変換し、サブピクセル精度を達成するとともに、大規模なシーンにおける一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1群別相関に基づく軽量なコストボリュームは、MVSにおける精度を維持しつつ、メモリと計算量を削減できるか?
  • RQ2サブピクセル精度と一般化性能の観点から、逆深度回帰は均一な深度回帰や逆深度分類を上回るか?
  • RQ3段階的な3D U-Netは、標準的な3D U-Netや再帰的正則化と比較して、曖昧な領域やエッジ領域における深度推定を改善できるか?
  • RQ4本手法は、制限のない高いメモリ使用量を伴わずに、高解像度および大規模なシーンにスケーリングできるか?
  • RQ5本手法は、変分リファインメントやCRFのような事後処理のリファインメントへの依存度をどの程度低減できるか?

主な発見

  • DTUデータセットでは、CIDERは平均完全性スコア0.437および全体スコア0.427を達成し、リファインメントなしでMVSNetやR-MVSNetを上回った。
  • Tanks and Temples Intermediateデータセットでは、CIDERはF1スコア46.76%を達成し、MVSNetを3.28%上回り、大規模なシーンでも優れた性能を示した。
  • Tanks and Temples Advancedデータセットでは、CIDERはF1スコア23.12%を達成し、リファインメントなしでR-MVSNetを上回り、困難な大規模環境におけるロバスト性を示した。
  • 段階的な3D U-Netフィルタリングは、AGC-IDRと比較して曖昧な領域におけるノイズを顕著に低減し、大きなメモリ増加を伴わずに再構築品質を向上させた。
  • 256個の深度サンプルを用いた場合、CIDERはTanks and TemplesトレーニングセットでF1スコアを48.66%から49.60%まで向上させつつ、許容可能なメモリ使用量を維持した。
  • 提案された相関コストボリュームは、任意の数のソース画像へのスケーラビリティを実現し、従来の3Dコストボリュームと比較してメモリ消費を削減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。