Skip to main content
QUICK REVIEW

[논문 리뷰] M^3VSNet: Unsupervised Multi-metric Multi-view Stereo Network

Baichuan Huang, Hongwei Yi|arXiv (Cornell University)|2020. 04. 21.
Advanced Vision and Imaging참고 문헌 40인용 수 10
한 줄 요약

M^3VSNet는 픽셀 단위 손실과 다중 척도 특징 단위 손실 함수를 조합하고, 노말-깊이 일관성 정규화를 추가하여 깊이 추정의 견고성과 완전성을 향상시키는 비지도 다중 척도 다중 측면 스테레오 네트워크를 제안한다. DTU에서 비지도 방법 중 최고 성능을 기록하며, 트레이닝에 태깅되지 않은 텍스처가 없는, 반사성 또는 반복적인 영역과 같은 도전적인 환경에서도 성능이 뛰어나며, 트레이닝 후 미세조정 없이도 대규모 실세계 환경에 대해 강력한 일반화 능력을 보여준다.

ABSTRACT

The present Multi-view stereo (MVS) methods with supervised learning-based networks have an impressive performance comparing with traditional MVS methods. However, the ground-truth depth maps for training are hard to be obtained and are within limited kinds of scenarios. In this paper, we propose a novel unsupervised multi-metric MVS network, named M^3VSNet, for dense point cloud reconstruction without any supervision. To improve the robustness and completeness of point cloud reconstruction, we propose a novel multi-metric loss function that combines pixel-wise and feature-wise loss function to learn the inherent constraints from different perspectives of matching correspondences. Besides, we also incorporate the normal-depth consistency in the 3D point cloud format to improve the accuracy and continuity of the estimated depth maps. Experimental results show that M3VSNet establishes the state-of-the-arts unsupervised method and achieves comparable performance with previous supervised MVSNet on the DTU dataset and demonstrates the powerful generalization ability on the Tanks and Temples benchmark with effective improvement. Our code is available at https://github.com/whubaichuan/M3VSNet.

연구 동기 및 목표

  • 감독 학습에서의 지도 기반 MVS 학습에서 접근 가능한 진짜 깊이 맵의 부족이 일반화 및 확장성에 제한을 줌을 해결하기 위해.
  • 텍스처가 없는, 반사성 또는 반복적인 영역과 같은 도전적인 상황에서 비지도 MVS 재구성의 견고성과 완전성을 향상시키기 위해.
  • 3D 세계 좌표계에서 노말-깊이 일관성을 통합하여 깊이 맵의 정확성과 연속성을 향상시키기 위해.
  • 픽셀 수준과 특징 수준의 매칭 제약 조건을 모두 활용하는 다중 척도 손실 함수를 개발하여 더 나은 대응 학습을 향상시키기 위해.
  • 도메인 특화 미세조정 없이도 대규모 실세계 환경에 대해 강력한 제로샷 일반화 능력을 입증하기 위해.

제안 방법

  • VGG16 특징을 사용하여 픽셀 수준의 광학적 손실과 다중 척도 특징 수준의 유사도 손실을 조합한 새로운 다중 척도 손실을 제안한다.
  • 사전 훈련된 VGG16에서 얻은 다중 척도 특징 맵을 활용하여 일관성 있는 매칭을 위해 저수준 텍스처와 고수준 의미 정보를 모두 포괄한다.
  • 3D 공간에서 추정된 표면 노말과 국소 깊이 기울기 간의 수직성을 강제하여 노말-깊이 일관성 정규화를 도입한다.
  • 다중 척도 피라미드 특징 집약을 통해 더 풍부한 맥락 정보를 가진 3D 비용 볼륨을 구성하여 특징 매칭을 향상시킨다.
  • 진짜 깊이 지도 없이 다중 시점 이미지만을 사용하여 엔드 투 엔드로 비지도 방식으로 네트워크를 훈련시킨다.
  • Tanks & Temples 벤치마크에서 정확성과 완전성의 균형을 맞추기 위해 깊이 융합 과정에서 광학 임계값(0.6)을 적용한다.

실험 결과

연구 질문

  • RQ1픽셀과 특징 유사성의 조합으로 구성된 다중 척도 손실이 픽셀 단일 제약 조건을 초월해 비지도 MVS 성능을 향상시킬 수 있는가?
  • RQ2노말-깊이 일관성 정규화를 통합할 경우 추정된 깊이 맵의 정확성과 연속성은 어떻게 영향을 받는가?
  • RQ3비지도 MVS 모델이 DTU나 Tanks & Temples 벤치마크와 같은 대규모 실세계 환경에 대해 얼마나 잘 일반화되는가?
  • RQ4다중 척도 특징 표현은 텍스처가 없는 또는 반사성 영역에서 매칭의 견고성을 어떻게 향상시키는가?
  • RQ5제안된 방법은 어떤 진짜 깊이 지도도 없이 감독 기반 MVSNet과 유사한 성능을 달성할 수 있는가?

주요 결과

  • M^3VSNet는 DTU 데이터셋에서 비지도 MVS 방법 중 최고 성능을 기록하였으며, 평균 오차는 0.566, 임계값은 0.609였다.
  • Tanks & Temples 벤치마크에서 M^3VSNet는 평균 점수 37.67을 기록하여 MVS²를 능가하고 다른 비지도 방법들보다 뛰어난 성능을 보였다.
  • Tanks & Temples의 Playground 시나리오에서 M^3VSNet는 점수 47.39를 기록하여 MVS²의 43.48보다 뚜렷이 높았다.
  • 모델는 미세조정 없이도 대규모 실외 환경에서 높은 품질의 조밀한 포인트 클라우드를 생성하여 강력한 제로샷 일반화 능력을 보였다.
  • 다중 척도 특징 유사도 손실을 포함시킴으로써 텍스처가 없는 영역나 반사 영역에서의 매칭 오류가 픽셀 단일 손실 대비 감소하였다.
  • 노말-깊이 일관성 정규화는 특히 복잡한 표면 기하학을 가진 영역에서 깊이 맵의 연속성과 정확성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.