Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Adapt Multi-View Stereo by Self-Supervision

Arijit Mallick, Jörg Stückler|arXiv (Cornell University)|Sep 28, 2020
Advanced Vision and Imaging参考文献 37被引用数 5
ひとこと要約

本稿では、自己教師ありマルチビューステレオ(MVS)再構成のためのメタラーニング手法を提案する。この手法により、真値深度がなくても、新しいドメインへの迅速な適応が可能となる。多様なデータセットでモデルに依存しないメタラーニング(MAML)を用いてネットワークを訓練し、自己教師ありのファインチューニングで改善することで、ドメインシフトに対する耐性が向上する。自己教師あり学習において、DTUで最先端の性能を達成し、一部の教師ありベースラインを上回る主要な指標を達成している。

ABSTRACT

3D scene reconstruction from multiple views is an important classical problem in computer vision. Deep learning based approaches have recently demonstrated impressive reconstruction results. When training such models, self-supervised methods are favourable since they do not rely on ground truth data which would be needed for supervised training and is often difficult to obtain. Moreover, learned multi-view stereo reconstruction is prone to environment changes and should robustly generalise to different domains. We propose an adaptive learning approach for multi-view stereo which trains a deep neural network for improved adaptability to new target domains. We use model-agnostic meta-learning (MAML) to train base parameters which, in turn, are adapted for multi-view stereo on new domains through self-supervised training. Our evaluations demonstrate that the proposed adaptation method is effective in learning self-supervised multi-view stereo reconstruction in new domains.

研究の動機と目的

  • 1つの環境(例:屋外風景)で訓練されたモデルが、他の環境(例:屋内オブジェクトスキャン)で失敗する、マルチビューステレオ再構成におけるドメインシフトの課題に対処すること。
  • 高価で入手困難な真値深度アノテーションへの依存を減らすために、自己教師あり学習を活用すること。
  • メタラーニングを用いて一般化性能と新ドメインへの適応性を向上させ、最小限のラベル付きデータで迅速なファインチューニングを可能にすること。
  • オクルージョンなどの外れ値に影響されにくくするために、自己教師あり学習を強化するため、学習可能な信頼度マスクを導入すること。
  • 事前学習に教師あり学習を用いた場合でも、メタラーニングで学習したモデルが、ナーバルにファインチューニングされたモデルよりも優れた一般化性能を示すことを実証すること。

提案手法

  • モデルに依存しないメタラーニング(MAML)を採用し、少数ステップの自己教師ありファインチューニングで新ドメインに素早く適応可能なベースネットワーク重みを学習する。
  • 屋内・屋外の多様なシーンを含むBlendedMVSデータセットでモデルを事前学習し、転送可能な特徴を学習する。
  • ターゲットドメイン(例:DTUデータセット)で、微分可能な再投影損失を用いた自己教師あり学習により、メタラーニングしたモデルをファインチューニングする。
  • MVSNetを拡張し、自己教師あり損失の各画素に重みを付ける学習可能な信頼度マスクを導入し、オクルージョンなどの外れ値の影響を低減する。
  • コストボリュームに対して3次元畳み込みリファインメントヘッドを適用し、信頼度マスクがトレーニング中の損失に影響を与えるようにする。
  • 信頼度の高い画素で高い誤差を生じさせないよう、微分可能な損失を用いて信頼度マスクをエンドツーエンドで訓練し、ノイズの多い予測に対する耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1標準的なファインチューニングと比較して、メタラーニングは未学習ドメインにおける自己教師ありマルチビューステレオ再構成性能を向上させるか?
  • RQ2学習可能な信頼度マスクを導入することで、オクルージョンや外れ値の影響を低減し、自己教師あり学習の性能が向上するか?
  • RQ3メタラーニングによる自己教師あり適応は、教師あり事前学習 followed by 自己教師ありファインチューニングと比較して優れているか?
  • RQ4提案手法は、DTUのようなベンチマークデータセットにおいて、教師あり手法と競合する性能を達成できるか?
  • RQ5提案手法は、屋外建築風景から屋内オブジェクトスキャンに至るまで、多様なドメインに一般化可能か?

主な発見

  • 提案手法は、DTUデータセットにおいて2 mmの閾値でのFスコアが68.67%に達し、自己教師ありベースラインのMVSNet(51.98%)および教師ありのSurfaceNet(67.49%)を上回った。
  • 信頼度マスクを導入した場合、Fスコアは68.67%に達したのに対し、導入しない場合の65.31%と比較して、外れ値の処理効果が明確に示された。
  • 自己教師ありファインチューニング下で、メタラーニングモデルは教師あり事前学習ベースライン(Sup PT bMVS, Self FT DTU)のFスコア(67.49%)を上回った。
  • 定性的な結果では、再構成の完全性と詳細の保持が優れており、教師ありMVSNetと類似した品質を示し、SurfaceNetを上回った。
  • アブレーションスタディにより、事前学習が教師ありであっても、メタラーニングが標準的なファインチューニングよりも適応性能を向上させることを確認した。
  • DTUベンチマークにおいて、自己教師ありMVS手法の中で、特に1 mmおよび2 mmの閾値での全体的なFスコアで最先端の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。