Skip to main content
QUICK REVIEW

[논문 리뷰] MVS^2: Deep Unsupervised Multi-view Stereo with Multi-View Symmetry

Yuchao Dai, Zhidong Zhu|arXiv (Cornell University)|2019. 08. 30.
Advanced Vision and Imaging참고 문헌 36인용 수 18
한 줄 요약

이 논문은 다중 시야 입체 영역에서 지도 학습이 필요 없이 다중 시야 대칭성과 교차 시야 일致성을 활용하여 모든 시야의 깊이 맵을 동시에 예측하는 최초의 비지도 딥 러닝 프레임워크인 MVS^2를 제안한다. 이 방법은 지도 학습을 위한 진짜 깊이 데이터가 없이도 교차 시야 일치를 강제함으로써 여러 벤치마크에서 최신 기술 수준의 성능을 달성하며, 대칭적이고 종단 간(end-to-end) 훈련을 통해 영상 일致성과 학습된 막힘 지도를 활용하여 훈련 없이도 강력한 일반화 성능을 보여준다.

ABSTRACT

The success of existing deep-learning based multi-view stereo (MVS) approaches greatly depends on the availability of large-scale supervision in the form of dense depth maps. Such supervision, while not always possible, tends to hinder the generalization ability of the learned models in never-seen-before scenarios. In this paper, we propose the first unsupervised learning based MVS network, which learns the multi-view depth maps from the input multi-view images and does not need ground-truth 3D training data. Our network is symmetric in predicting depth maps for all views simultaneously, where we enforce cross-view consistency of multi-view depth maps during both training and testing stages. Thus, the learned multi-view depth maps naturally comply with the underlying 3D scene geometry. Besides, our network also learns the multi-view occlusion maps, which further improves the robustness of our network in handling real-world occlusions. Experimental results on multiple benchmarking datasets demonstrate the effectiveness of our network and the excellent generalization ability.

연구 동기 및 목표

  • 대규모 진짜 깊이 데이터에 크게 의존하는 지도 학습 기반 MVS 방법의 한계를 해결하기 위해, 이러한 데이터가 흔하지 않아 새로운 시나리오에 대한 일반화를 방해한다는 점을 다루기 위해.
  • 3D 지도 학습이 필요 없이도 다양한 시야 간 기하학적 일치성을 유지하는 비지도 딥 러닝 프레임워크를 개발하기 위해.
  • 대칭적 다중 시야 예측을 통한 깊이 맵과 막힘 지도의 동시 학습을 통해 실제 막힘 상황에서의 강건성을 향상시키기 위해.
  • 교차 시야 깊이 일치가 제약 조건이 되는 이미지 왜곡 오차만으로도 종단 간 딥 MVS 네트워크 훈련을 효과적으로 이끌 수 있는가를 입증하기 위해.

제안 방법

  • 모든 입력 시야에 대해 동시에 깊이 맵을 예측하는 대칭적 아키텍처를 사용하여, 단일 기준 이미지에 의존하지 않고 각 시야를 동등하게 취급한다.
  • 예측된 깊이 맵 기반으로 가역성 있는 호모지어피 왜곡을 사용하여 다중 시야 간 영상 일치 손실을 생성한다.
  • 다른 시야에서의 깊이 맵 간 기하학적 일치를 강제하기 위해 교차 시야 일치 손실을 도입하여 훈련 및 추론 중 3D 일관성을 증진시킨다.
  • 깊이 일관성을 활용하여 훈련 중에 막힌 영역를 탐지하고 억제함으로써 다중 시야 막힘 추론을 통합한다.
  • 진짜 깊이 맵이 필요 없이 오직 이미지 왜곡 오차만을 지도로 사용하여 종단 간(end-to-end)으로 네트워크를 훈련시킨다.
  • 막힘 지도와 깊이 맵을 교차 최적화 방식으로 갱신하여 강건성과 일관성을 향상시킨다.

실험 결과

연구 질문

  • RQ1딥 러닝 기반 MVS 시스템이 어떤 진짜 3D 지도 학습 없이도 높은 품질의 깊이 추정을 달성할 수 있는가?
  • RQ2다중 시야 대칭성을 어떻게 활용하여 다수의 시야에서 유도된 깊이 맵 간 기하학적 일관성을 강제할 수 있는가?
  • RQ3교차 시야 깊이 일치가 MVS 네트워크 훈련을 위한 효과적인 자기 지도 신호로 기능할 수 있는가?
  • RQ4학습된 막힘 지도의 통합이 실제 막힘 상황에서의 강건성을 어떻게 향상시키는가?
  • RQ5비지도 MVS 모델이 훈련 없이도 새로운 데이터셋에 얼마나 잘 일반화되는가?

주요 결과

  • MVS^2는 모든 벤치마크 데이터셋에서 전통적인 기하 기반 방법인 COLMAP을 능가하며, 3D 지도 학습 없이도 딥 페처 학습의 우수성을 입증한다.
  • SUN3D 데이터셋에서 MVS^2는 절대 상대 오차(Abs Rel) 0.3488을 기록하여 COLMAP(0.6232)와 DeMoN(0.2137)을 모두 능가하며, DeepMVS와 같은 지도 학습 방법과 키 메트릭에서 동등하거나 슈퍼어리어를 기록한다.
  • RGB-D 데이터셋에서 MVS^2는 Abs Rel 0.4414와 RMSE 1.2853을 달성하여 COLMAP(0.5389 및 1.5051)을 능가하며, 훈련 없이도 강력한 일반화 성능을 보여준다.
  • DTU 데이터셋에서 MVS^2는 Abs Rel 0.3729와 RMSE 1.3938을 기록하여 COLMAP(0.3841 및 1.4795)을 능가하며, DeepMVS와 같은 지도 학습 방법의 성능에 가까워진다.
  • Scenes11 데이터셋에서 MVS^2는 Abs Rel 0.5981과 RMSE 2.9477을 기록하여 COLMAP(0.6249 및 3.6575)을 크게 능가하며, 다양한 시나리오에 걸쳐 잘 일반화됨을 보여준다.
  • Tanks and Temples에서의 정성적 결과는 MVS^2가 어떤 훈련 없이도 세밀한 3D 포인트 클라우드를 재구성할 수 있음을 확인하며, 강력한 제로샷 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.