Skip to main content
QUICK REVIEW

[논문 리뷰] OmniMVS: End-to-End Learning for Omnidirectional Stereo Matching

Changhee Won, Jongbin Ryu|arXiv (Cornell University)|2019. 08. 17.
Advanced Vision and Imaging참고 문헌 5인용 수 4
한 줄 요약

이 논문은 볼록망원 렌즈 이미지를 사용한 전방위 스테레오 매칭을 위한 엔드 투 엔드 딥 러닝 프레임워크인 OmniMVS를 제안한다. 기하학적 맥락을 활용하여 무늬가 없고 반사성이 있거나 가림당하는 영역에서 최신 기술 수준의 성능을 달성하기 위해, 두 개의 합성 데이터셋인 OmniThings와 OmniHouse를 도입한다. 그 결과, 회색조 입력이 RGB 입력과 비교해 유사하거나 더 좋은 성능을 내며, 무늬가 없는 영역에서 뛰어난 성능을 발휘한다.

ABSTRACT

In this paper, we propose a novel end-to-end deep neural network model for omnidirectional depth estimation from a wide-baseline multi-view stereo setup. The images captured with ultra wide field-of-view (FOV) cameras on an omnidirectional rig are processed by the feature extraction module, and then the deep feature maps are warped onto the concentric spheres swept through all candidate depths using the calibrated camera parameters. The 3D encoder-decoder block takes the aligned feature volume to produce the omnidirectional depth estimate with regularization on uncertain regions utilizing the global context information. In addition, we present large-scale synthetic datasets for training and testing omnidirectional multi-view stereo algorithms. Our datasets consist of 11K ground-truth depth maps and 45K fisheye images in four orthogonal directions with various objects and environments. Experimental results show that the proposed method generates excellent results in both synthetic and real-world environments, and it outperforms the prior art and the omnidirectional versions of the state-of-the-art conventional stereo algorithms.

연구 동기 및 목표

  • 무늬가 없고 반사성 또는 가림이 발생하는 영역에서 전방위 볼록망원 렌즈 이미지의 스테레오 매칭 문제를 해결하기 위해.
  • 다양한 광학적 및 기하학적 환경에서 일반화할 수 있는 딥 러닝 프레임워크를 개발하기 위해.
  • 실세계 환경에서 전방위 시스템의 스테레오 매칭에 있어 회색조 입력이 RGB 입력과 유사하거나 더 좋은 성능을 내는지 입증하기 위해.
  • 실세계 도전 과제를 시뮬레이션하는 합성 데이터셋을 제작하고, 이를 통해 강력한 스테레오 매칭 모델을 훈련시키기 위해.

제안 방법

  • 볼록망원 렌즈 이미지의 표면에 균일하게 분포하도록 보장하기 위해 거부 샘플링 방법을 사용하여, 무작위 텍스처, 회전, 크기를 가진 64개의 ShapeNet 객체를 무작위로 배치하여 OmniThings 데이터셋을 합성한다.
  • SUNCG 기반 실내 환경에서 무작위 카메라 위치와 방향을 포함하여 OmniHouse 데이터셋을 생성하며, 햇빛이 비치는 하늘과 같은 현실적인 배경을 통합하여 실세계 조건을 시뮬레이션한다.
  • 볼록망원 스테레오 이미지 쌍과 역 깊이 진짜값을 사용하여, OmniThings 데이터셋에서 OmniMVS를 엔드 투 엔드로 훈련시킨다.
  • 모호한 영역에서의 성능 향상을 위해, Sunny 및 OmniHouse 데이터셋에서 OmniMVS를 미세조정한다 (OmniMVS-ft로 표기).
  • 무늬가 적거나 반사성이 높은 영역에서 매칭 비용 추정을 향상시키기 위해 기하학적 맥락 정규화를 적용한다.
  • 훈련을 위해 현실적인 볼록망원 이미지와 해당하는 역 깊이 맵을 생성하기 위해 가역적 렌더링 파이프라인을 사용한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 딥 러닝 모델이 다양한 광학적 및 기하학적 조건에서 전방위 볼록망원 렌즈 이미지에서 강력한 스테레오 매칭을 달성할 수 있는가?
  • RQ2OmniThings 및 OmniHouse와 같은 합성 데이터셋이 실세계 스테레오 매칭 작업의 일반화 능력을 어느 정도 향상시키는가?
  • RQ3전방위 시스템의 스테레오 매칭에서 회색조 입력이 RGB 입력과 유사하거나 더 좋은 성능을 내는가?
  • RQ4기하학적 맥락 정규화가 텍스처가 없는 영역나 반사성 영역에서 매칭 정확도 향상에 얼마나 효과적인가?
  • RQ5특정 도메인의 데이터셋(예: OmniHouse)에서의 미세조정이 어려운 실세계 환경에서 성능을 크게 향상시키는가?

주요 결과

  • OmniMVS-ft는 회색조 입력을 사용하여 OmniHouse 데이터셋에서 >1mm 임계값 기준 87.70%의 정확도를 달성하며, 원본 PSMNet 및 DispNet-CSS 모델을 초월한다.
  • Sunny 데이터셋에서 OmniMVS-ft는 회색조 입력을 사용하여 >1mm 임계값 기준 93.24%의 정확도를 기록하며, RGB 기반 기준선을 뛰어넘는다.
  • 회색조 입력 사용 시 RGB 대비 略적으로 우수하거나 동등한 성능을 보이며, 실세계 테스트 세트에서 PSMNet의 RMS 오차는 4.11–4.20, DispNet-CSS-ft의 RMS 오차는 3.44–3.46을 기록한다.
  • OmniHouse 및 Sunny 데이터셋에서의 미세조정은 텍스처가 없는 표면과 반사성 표면에서 성능을 크게 향상시키며, OmniHouse 데이터셋에서 MAE를 7.28에서 3.51로 감소시킨다.
  • OmniThings 데이터셋은 효과적인 사전 훈련을 가능하게 하며, OmniHouse는 복잡한 기하학적 구조와 조명 조건을 가진 실세계 실내 환경으로의 일반화 능력을 향상시킨다.
  • 모델는 합성 데이터에서 훈련되었음에도 불구하고 실 볼록망원 스테레오 데이터에 대해 강력한 제로샷 일반화 성능를 보이며, 표준 벤치마크에서 경쟁 가능한 성능을 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.