Skip to main content
QUICK REVIEW

[논문 리뷰] BlendedMVS: A Large-scale Dataset for Generalized Multi-view Stereo Networks

Yao Yao, Zixin Luo|arXiv (Cornell University)|2019. 11. 22.
Advanced Vision and ImagingComputer Science참고 문헌 35인용 수 22
한 줄 요약

이 논문은 일반화된 다중 시점 스테레오(MVS) 네트워크를 훈련시키기 위한 대규모 합성 데이터셋인 BlendedMVS를 소개한다. 실제 이미지에서 고품질의 질감이 있는 3D 메시를 재구성하고, 이를 새로운 시점에서 렌더링함으로써, 렌더링된 색상 이미지와 입력 이미지를 혼합하여 현실적인 조명을 유지하면서 깊이 맵과의 일관성을 확보한 훈련 데이터를 생성한다. BlendedMVS로 훈련된 모델은 기존 데이터셋에 비해 일반화 성능이 크게 향상된다.

ABSTRACT

While deep learning has recently achieved great success on multi-view stereo (MVS), limited training data makes the trained model hard to be generalized to unseen scenarios. Compared with other computer vision tasks, it is rather difficult to collect a large-scale MVS dataset as it requires expensive active scanners and labor-intensive process to obtain ground truth 3D structures. In this paper, we introduce BlendedMVS, a novel large-scale dataset, to provide sufficient training ground truth for learning-based MVS. To create the dataset, we apply a 3D reconstruction pipeline to recover high-quality textured meshes from images of well-selected scenes. Then, we render these mesh models to color images and depth maps. To introduce the ambient lighting information during training, the rendered color images are further blended with the input images to generate the training input. Our dataset contains over 17k high-resolution images covering a variety of scenes, including cities, architectures, sculptures and small objects. Extensive experiments demonstrate that BlendedMVS endows the trained model with significantly better generalization ability compared with other MVS datasets. The dataset and pretrained models are available at \url{https://github.com/YoYo000/BlendedMVS}.

연구 동기 및 목표

  • 기반 학습 다중 시점 스테레오(MVS) 네트워크를 위한 대규모, 다양한, 현실적인 훈련 데이터의 부족을 해결하기 위해.
  • 실제 이미지에서 유래한 현실적인 환경 조명과 시각적 단서를 합성 훈련 데이터에 통합하여 모델의 일반화 성능을 향상시키기 위해.
  • 비용이 많이 드는 활성 스캐너에 의존하지 않고도 고품질의 훈련 데이터를 스케일링하고 저비용으로 생성할 수 있는 파이프라인을 제공하기 위해.
  • DTU와 같은 작은 고정 궤적 데이터셋을 넘어서 다양한 실제 환경에서의 성능 향상을 가능하게 하기 위해.
  • 깊이, 음영, 노멀 맵과 같은 rich한 애너테이션을 제공하여 향후 3D 기하학 작업 연구를 지원하기 위해.

제안 방법

  • 실제 이미지에서 고해상도 질감이 있는 3D 메시를 3D 재구성 파이프라인을 사용해 재구성한다.
  • 다양한 시점에서 질감이 있는 메시를 렌더링하여 합성 색상 이미지와 해당 깊이 맵을 생성한다.
  • 렌더링된 색상 이미지와 원본 입력 이미지를 혼합하여 현실적인 조명과 질감을 유지하면서 깊이 맵과의 정렬을 확보한다.
  • 혼합된 이미지를 MVS 네트워크 훈련의 입력으로 사용하여 외관과 기하학 간의 일관성을 보장한다.
  • 훈련 중에 온라인 광학적 보정을 적용하여 뷰 의존적 조명 효과에 대한 내성을 더욱 향상시킨다.
  • 입력 이미지에서 동적 요소(예: 사람)를 제거하거나 흐리게 처리하여 데이터 프라이버시를 확보한다.

실험 결과

연구 질문

  • RQ1실제 이미지와 렌더링된 이미지를 혼합한 합성 데이터셋이 다양한 실제 환경에서 MVS 네트워크의 일반화 성능을 향상시킬 수 있는가?
  • RQ2렌더링된 훈련 데이터에 실제 입력 이미지의 환경 조명을 통합할 경우 모델 성능에 어떤 영향을 미치는가?
  • RQ3BlendedMVS와 같은 대규모이고 다양한 데이터셋으로 훈련하면 DTU 및 Tanks and Temples와 같은 벤치마크 데이터셋에서 더 나은 성능을 내는가?
  • RQ4광학적 보정이 MVS 네트워크의 조명 변화에 대한 내성에 얼마나 기여하는가?
  • RQ5제안된 데이터 생성 파이프라인이 MVS를 초월한 다른 3D 기하학 작업에 적용 가능한가?

주요 결과

  • BlendedMVS로 훈련된 모델은 DTU, Tanks and Temples, ETH3D 벤치마크에서 다른 데이터셋으로 훈련된 모델에 비해 훨씬 뛰어난 일반화 성능을 기록한다.
  • 절단 실험 결과, 온라인 광학적 보정을 적용한 혼합 이미지로 훈련한 경우 DTU 데이터셋에서 가장 낮은 검증 오차를 기록하며, 입력 이미지 또는 렌더링된 이미지만으로 훈련한 경우보다 우수한 성능을 보인다.
  • 입력 이미지만으로 훈련해도 만족스러운 결과를 얻을 수 있었으며, 이는 재구성된 3D 모델이 훈련을 위한 반지표(semi-ground truth)로 충분히 정확하다는 것을 시사한다.
  • 혼합 이미지 사용은 보행자와 같은 동적 요소를 훈련 데이터에서 흐리게 처리하거나 제거함으로써 프라이버시를 효과적으로 보호한다.
  • 이 데이터셋은 도시, 건축, 조각, 소형 물체 등 113개의 다양한 환경에서 17,000장이 넘는 고해상도 이미지를 포함한다.
  • 이 데이터셋은 향후 가시성 인식 및 패치 기반 MVS 네트워크에 유용한 음영 맵과 노멀 맵과 같은 추가 애너테이션도 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.