Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Learning of Depth Inference for Multi-view Stereo

Jiayu Yang, José M. Alvarez|arXiv (Cornell University)|Apr 7, 2021
Advanced Vision and Imaging参考文献 27被引用数 4
ひとこと要約

本稿では、反復的精錬を用いて高品質な疑似深度ラベルを生成する自己教師付き学習フレームワークを提案し、DTUデータセットにおいて教師あり手法と同等の性能を達成した。この手法は、画像再構成に基づく教師なし深度推定を用い、高解像度推論とマルチビュー融合を用いて疑似ラベルを精錬し、教師あり深度ラベルに依存せずにネットワーク性能を反復的に向上させる。

ABSTRACT

Recent supervised multi-view depth estimation networks have achieved promising results. Similar to all supervised approaches, these networks require ground-truth data during training. However, collecting a large amount of multi-view depth data is very challenging. Here, we propose a self-supervised learning framework for multi-view stereo that exploit pseudo labels from the input data. We start by learning to estimate depth maps as initial pseudo labels under an unsupervised learning framework relying on image reconstruction loss as supervision. We then refine the initial pseudo labels using a carefully designed pipeline leveraging depth information inferred from higher resolution images and neighboring views. We use these high-quality pseudo labels as the supervision signal to train the network and improve, iteratively, its performance by self-training. Extensive experiments on the DTU dataset show that our proposed self-supervised learning framework outperforms existing unsupervised multi-view stereo networks by a large margin and performs on par compared to the supervised counterpart. Code is available at https://github.com/JiayuYANG/Self-supervised-CVP-MVSNet.

研究の動機と目的

  • MVSネットワークの学習に必要な大規模なマルチビュー深度データを取得する課題に対処すること。
  • 教師あり深度ラベルに依存しない自己教師付き学習フレームワークの開発すること。
  • 画像再構成に基づく教師なし推定から生成される疑似深度ラベルの品質を向上させ、より良い監視を実現すること。
  • 教師ありMVSネットワークと同等の性能を、マルチビュー画像のみを用いて達成すること。
  • マルチステージ処理による反復的精錬を通じて、疑似ラベルを改善し、ネットワークの一般化性能を向上させること。

提案手法

  • 画像再構成損失を用いて写真的一致性を強制することで、写真的一致性を保証する教師なし学習により、初期深度マップを生成する。
  • 高解像度画像を用いて信頼できるピクセルのより正確な深度推定を実行し、初期疑似ラベルの品質を向上させる。
  • 隣接するビュー間の深度の一貫性を活用することで、疑似ラベルをフィルタリングし、誤差を低減する。
  • マルチビュー深度統合とメッシュ生成を適用して、不完全な疑似ラベルを補完し、空間的整合性を向上させる。
  • 精錬された疑似ラベルを用いて、ネットワークを反復的自己学習ループで監視し、時間経過とともに性能を向上させる。
  • フレームワークはCVP-MVSNetの要素を統合し、段階的自己監視により、段階的に深度推定を向上させる。

実験結果

リサーチクエスチョン

  • RQ1教師あり深度ラベルが一切存在しない状況下でも、自己教師付き学習フレームワークが高品質な疑似深度ラベルを生成できるか?
  • RQ2高解像度推論とマルチビュー統合を用いて初期教師なし疑似ラベルを精錬することで、深度推定の精度がどの程度向上するか?
  • RQ3精錬された疑似ラベルを用いた反復的自己学習によって、教師なしと教師ありMVSネットワークの性能格差をどの程度埋めることができるか?
  • RQ4本手法の限界はテクスチャの欠落した領域に顕著であり、その問題はどのように解決できるか?
  • RQ5提案された精錬パイプラインは、訓練の各イテレーションにおいて安定的かつ一貫した性能向上をもたらすか?

主な発見

  • 提案された自己教師付きフレームワークは、DTUデータセットにおいて、既存の教師なしMVSネットワークを大きく上回った。
  • 反復的自己学習を経て、3回目のイテレーションでfスコアが88.42%に達し、教師あり手法(88.61%)と0.12%しか差がなかった。
  • 3回目のイテレーション以降、モデルの性能が安定化しており、継続的な自己監視による劣化は観察されなかった。
  • 高解像度疑似ラベル精錬とマルチビュー統合の活用により、再構成品質が著しく向上し、全体の誤差が0.567から0.363に低下した。
  • 本手法は、教師なしMVSネットワークにおける最先端の性能を達成し、マルチビュー画像のみから強力な一般化性能を示した。
  • 主な限界はテクスチャの欠落した領域にあり、初期教師なし段階では光度的一致性が欠落するため、深度ラベルが一切生成されない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。