Skip to main content
QUICK REVIEW

[논문 리뷰] 360SD-Net: 360° Stereo Depth Estimation with Learnable Cost Volume

Ning-Hsu Wang, Bolivar Solarte|arXiv (Cornell University)|2019. 11. 11.
Advanced Vision and Imaging참고 문헌 35인용 수 7
한 줄 요약

360SD-Net는 상하 equirectangular 이미지 쌍을 사용하여 360° 스테레오 깊이 추정을 위한 엔드 투 엔드 딥 러닝 프레임워크를 제안하며, 가용 비용 볼륨과 극각 인코딩을 통해 왜곡을 해결한다. 이는 합성 360° 스테레오 데이터셋에서 최고 성능을 기록하고, 소비자 수준의 카메라를 사용한 실제 환경으로도 효과적으로 일반화된다.

ABSTRACT

Recently, end-to-end trainable deep neural networks have significantly improved stereo depth estimation for perspective images. However, 360° images captured under equirectangular projection cannot benefit from directly adopting existing methods due to distortion introduced (i.e., lines in 3D are not projected onto lines in 2D). To tackle this issue, we present a novel architecture specifically designed for spherical disparity using the setting of top-bottom 360° camera pairs. Moreover, we propose to mitigate the distortion issue by (1) an additional input branch capturing the position and relation of each pixel in the spherical coordinate, and (2) a cost volume built upon a learnable shifting filter. Due to the lack of 360° stereo data, we collect two 360° stereo datasets from Matterport3D and Stanford3D for training and evaluation. Extensive experiments and ablation study are provided to validate our method against existing algorithms. Finally, we show promising results on real-world environments capturing images with two consumer-level cameras.

연구 동기 및 목표

  • 표준 스테레오 깊이 방법의 직접 적용을 방해하는 equirectangular 360° 이미지의 심각한 왜곡 문제를 해결한다.
  • 상하 360° 카메라 구성에 특화된 새로운 딥 러닝 아키텍처를 설계하여 에피포러라 라인 정렬을 유지한다.
  • 구면 좌표 정보(극각)와 가용 이동 필터를 통합하여 기하학적 왜곡 영향을 완화한다.
  • 학습 및 평가를 위한 지도 기반 깊이/편차 지도를 제공하는 두 개의 새로운 360° 스테레오 데이터셋(MP3D 및 SF3D)을 수집하고 공개한다.
  • 소비자 수준의 360° 카메라를 사용한 실제 환경으로 합성 데이터로 훈련된 모델의 일반화 능력을 입증한다.

제안 방법

  • 구면 투영에서 발생하는 공간 왜곡을 모델링하기 위해 RGB 이미지 특징과 극각 인코딩을 별도의 이중 브랜치 입력 스트림으로 도입한다.
  • 고정된 픽셀 이동 대신 가용 이동 필터를 사용하는 가용 비용 볼륨(LCV) 모듈을 제안하여 다양한 왜곡 수준에서 적응형 비용 집계를 가능하게 한다.
  • 다중 척도 특징 학습 및 경계 처리를 향상시키기 위해 아트로우스 스페이셜 피라미드 풀링(ASPP)과 복제 패딩을 통합한다.
  • 편차 및 깊이에 대한 지도 기반 손실을 사용하여 네트워크를 엔드 투 엔드로 훈련하고, 정확도 향상을 위해 데이터 증강 기법을 적용한다.
  • 에피포러라 라인을 수직으로 정렬하기 위해 상하 카메라 구성 방식을 사용하여 equirectangular 공간 내 대응 관계 탐색을 단순화한다.
  • Matterport3D와 Stanford3D의 합성 데이터를 활용하여 모델을 훈련하고, 실제 환경으로의 일반화를 위해 도메인 적응 기법을 적용한다.

실험 결과

연구 질문

  • RQ1심각한 기하학적 왜곡 상황에서, 가용 비용 볼륨 메커니즘이 기존 고정 이동 비용 볼륨보다 360° 스테레오 깊이 추정에서 더 우수한 성능을 내는가?
  • RQ2극각 정보를 통합할 경우, equirectangular 360° 이미지에서 깊이 추정 정확도는 어느 정도 향상되는가?
  • RQ3합성 360° 스테레오 데이터로 훈련된 모델은 소비자 수준의 360° 카메라를 사용한 실제 환경으로 얼마나 잘 일반화되는가?
  • RQ4가용 이동 필터의 최적의 초기 스텝 사이즈는 무엇이며, 성능에 어떤 영향을 미치는가?
  • RQ5제안된 아키텍처는 360° 데이터에서 기존의 고전적 및 딥 러닝 스테레오 매칭 방법과 비교해 최고 성능을 달성하는가?

주요 결과

  • 360SD-Net는 MP3D 및 SF3D 합성 360° 스테레오 데이터셋에서 PSMNet 및 GCNet을 능가하는 최고 성능을 기록하며, 깊이 및 편차 추정 모두에서 뛰어난 성능을 보였다.
  • 제거 실험 결과, 극각 인코딩이 MP3D에서 상대 오차 1.2% 향상 및 절대 오차 0.8% 향상으로 성능 향상을 입증하였다.
  • 초기 스텝 사이즈 1/3°를 가진 가용 비용 볼륨(LCV)이 최고 성능을 보였으며, 고정 이동 기반 베이스라인 대비 1.5% 향상된 성능을 기록하였다.
  • 모델은 실제 환경으로의 일반화가 뛰어나며, 두 대의 Insta360 ONE X 카메라에서 생성된 깊이 맵은 도메인 시프트가 있음에도 불구하고 명확한 물체 구조와 정확한 포인트 클라우드 재구성 결과를 보였다.
  • 정성적 결과에서는 특히 고도의 왜곡 지역과 물체 경계에서 더 선명한 깊이 맵과 더 정확한 3D 기하학을 입증하였다.
  • PSMNet 대비 런타임 오버헤드가 약간 증가했지만 성능 향상이 뚜렷하여 뛰어난 효율-정확도 트레이드오프를 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.