Skip to main content
QUICK REVIEW

[논문 리뷰] Pano Popups: Indoor 3D Reconstruction with a Plane-Aware Network

Marc Eder, Pierre Moulon|arXiv (Cornell University)|2019. 07. 01.
Advanced Vision and Imaging참고 문헌 29인용 수 4
한 줄 요약

이 논문은 주요 곡률 기반의 새로운 손실 함수를 사용하여 기하학적 일致성을 향상시키는 평면 인식 컨볼루션 신경망을 제안한다. 이는 단일 $360^\circ$ 실내 이미지에서 깊이, 표면 법선, 평면 경계를 예측한다. 제안된 방법은 단안 옴니디렉셔널 깊이 및 법선 추정에서 최신 기술 수준의 성능를 달성하며, 지오데식 좌표 맵을 사전으로 사용하여 예측 결과를 조합함으로써 고품질의 3D '팝업' 재구성을 가능하게 한다.

ABSTRACT

In this work we present a method to train a plane-aware convolutional neural network for dense depth and surface normal estimation as well as plane boundaries from a single indoor $360^\circ$ image. Using our proposed loss function, our network outperforms existing methods for single-view, indoor, omnidirectional depth estimation and provides an initial benchmark for surface normal prediction from $360^\circ$ images. Our improvements are due to the use of a novel plane-aware loss that leverages principal curvature as an indicator of planar boundaries. We also show that including geodesic coordinate maps as network priors provides a significant boost in surface normal prediction accuracy. Finally, we demonstrate how we can combine our network's outputs to generate high quality 3D "pop-up" models of indoor scenes.

연구 동기 및 목표

  • perspective 이미지보다 넓은 시야를 제공하는 $360^\circ$ 옴니디렉셔널 이미지를 사용하여 실내 환경에서 단일 뷰 3D 재구성 문제를 해결한다.
  • 평면성 및 곡률과 같은 기하학적 사전 지식을 통합하여 옴니디렉셔널 이미지의 깊이 및 표면 법선 추정 정확도를 향상시킨다.
  • 예측된 깊이, 법선 및 평면 경계를 사용하여 단일 $360^\circ$ 이미지에서 고품질의 3D 평면 모델(즉, '팝업' 모델)을 생성하는 방법을 개발한다.
  • 지오데식 좌표 맵이 구면 이미지 표현에서 표면 법선 추정 정확도를 향상시키는 데 효과적인 사전으로 기능하는지 입증한다.
  • 기존 문헌에서 다루지 않은 분야인 $360^\circ$ 이미지에서의 평면 경계 검출 및 표면 법선 예측을 위한 벤치마크를 수립한다.

제안 방법

  • 깊이 및 표면 법선과 곡률 예측을 위한 별도의 디코더 브랜치를 갖춘 다중 스케일 인코더-디코더 CNN 아키텍처를 사용한다.
  • 각 픽셀의 기여도를 주요 곡률에 따라 조절하는 새로운 평면 인식 손실 함수를 도입하여 예측의 평면 일致성을 향상시킨다.
  • 지오데식 좌표 맵을 추가 입력 채널로 사용하여 네트워크가 구면 이미지 표면의 공간 관계를 더 잘 학습하도록 돕고, 법선 추정을 향상시킨다.
  • 평면 경계는 표면 법선의 불연속성을 탐지하는 별도의 헤드를 통해 예측하며, 3D 모델 생성을 위해 Otsu 임계처리를 사용해 연결된 성분을 분할한다.
  • RANSAC를 사용하여 법선 및 깊이 정보를 기반으로 평면 방정식을 추정하고, 이를 후방 투영 및 이코사헤드론 메esh 그리드에 메시화함으로써 3D 평면 모델을 재구성한다.
  • 예측된 법선에서 유도된 곡률을 포함한 깊이, 법선, 곡률 감독을 결합한 복합 손실을 사용하여 네트워크를 엔드 투 엔드로 훈련시킨다.
Figure 1 : Visualization of our paper’s contributions. Given an RGB omnidirectional image (top), we predict depth, surface normals, and plane boundary maps (middle) with state-of-the-art accuracy. Then we show we can use this information to achieve a planar segmentation and 3D reconstruction of the
Figure 1 : Visualization of our paper’s contributions. Given an RGB omnidirectional image (top), we predict depth, surface normals, and plane boundary maps (middle) with state-of-the-art accuracy. Then we show we can use this information to achieve a planar segmentation and 3D reconstruction of the

실험 결과

연구 질문

  • RQ1 주요 곡률 기반의 평면 인식 손실 함수가 $360^\circ$ 이미지의 깊이 및 표면 법선 추정 정확도를 향상시킬 수 있는가?
  • RQ2 지오데식 좌표 맵을 입력 사전으로 통합하면 옴니디렉셔널 이미지의 표면 법선 추정 정확도가 향상되는가?
  • RQ3 단일 $360^\circ$ 이미지가 스테레오 또는 다중 뷰 데이터 없이도 고품질의 3D 평면 재구성을 얼마나 잘 지원할 수 있는가?
  • RQ4 기존의 단안 깊이 추정 네트워크에 비해 제안된 방법이 옴니디렉셔널 이미지에 적용되었을 때 어떤 성능을 보이는가?
  • RQ5 네트워크의 출력을 효과적으로 조합하여 단일 입력 이미지에서 날카운 테두리의 평면형 3D '팝업' 모델을 생성할 수 있는가?

주요 결과

  • 제안된 평면 인식 손실 함수는 깊이 및 표면 법선 추정 정확도를 크게 향상시켜 $360^\circ$ 실내 깊이 추정 벤치마크에서 최신 기술 수준의 성능를 달성한다.
  • 지오데식 좌표 맵을 입력 채널로 통합하면 표면 법선 추정 정확도에 측정 가능한 향상이 있으며, 벽과 같은 큰 평면 표면에서의 오차를 감소시킨다.
  • 네트워크는 정확도가 높은 평면 경계 맵을 생성하여 장면 내 평면 영역의 강인한 임계처리 없는 분할을 가능하게 한다.
  • 네트워크 출력에서 유도된 3D '팝업' 모델은 날카운 잘 정의된 평면 경계를 보이며, 부드럽고 노이즈가 많은 재구성 결과를 보이는 기준 깊이 전용 방법보다 뛰어난 성능을 보인다.
  • RANSAC 평면 피팅 과정에 표면 법선을 통합함으로써 깊이 전용 피팅에 비해 훨씬 더 정확하고 안정적인 3D 재구성 결과를 얻을 수 있다.
  • 단일 $360^\circ$ 이미지가 기하학적 사전 지식과 곡률 인식 학습을 결합할 경우 세부 정보가 풍부하고 조각별 평면형 3D 재구성을 지원할 수 있음을 입증한다.
Figure 2 : Overview of our network architecture. The vectors next to each layer are $\left[\begin{smallmatrix}\text{input features}\\ \text{output features}\end{smallmatrix}\right]$ for each. Above each layer is the kernel size, ‘T’ indicates transposed convolution, ‘s#’ indicates stride, and ‘d#’ i
Figure 2 : Overview of our network architecture. The vectors next to each layer are $\left[\begin{smallmatrix}\text{input features}\\ \text{output features}\end{smallmatrix}\right]$ for each. Above each layer is the kernel size, ‘T’ indicates transposed convolution, ‘s#’ indicates stride, and ‘d#’ i

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.