Skip to main content
QUICK REVIEW

[논문 리뷰] View-volume Network for Semantic Scene Completion from a Single Depth Image

Yuxiao Guo, Xin Tong|arXiv (Cornell University)|2018. 06. 14.
Advanced Vision and Imaging참고 문헌 12인용 수 8
한 줄 요약

이 논문은 단일 깊이 이미지에서 3D 시각적 구조를 보다 정확하게 복원하기 위해 고해상도 2D 기하 특징과 3D 컨텍스트를 기반으로 하는 가변성 있는 투영층을 통해 융합하는 하이브리드 2D-3D 컨볼루션 네트워크인 View-Volume Network(VVNet)을 제안한다. VVNet는 이전의 3D-CNN 방법보다 훈련 속도가 3배 빠르고 추론 속도가 7배 이상 빠르며, 메모리 사용량도 줄이고 다중 해상도 특징 융합을 가능하게 하여 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

We introduce a View-Volume convolutional neural network (VVNet) for inferring the occupancy and semantic labels of a volumetric 3D scene from a single depth image. The VVNet concatenates a 2D view CNN and a 3D volume CNN with a differentiable projection layer. Given a single RGBD image, our method extracts the detailed geometric features from the input depth image with a 2D view CNN and then projects the features into a 3D volume according to the input depth map via a projection layer. After that, we learn the 3D context information of the scene with a 3D volume CNN for computing the result volumetric occupancy and semantic labels. With combined 2D and 3D representations, the VVNet efficiently reduces the computational cost, enables feature extraction from multi-channel high resolution inputs, and thus significantly improves the result accuracy. We validate our method and demonstrate its efficiency and effectiveness on both synthetic SUNCG and real NYU dataset.

연구 동기 및 목표

  • 단일 깊이 이미지에서 보이는 것과 가림된 3D 장면 구조를 추론하는 문제를 해결하기 위해.
  • 2D-CNN의 한계(3D 컨텍스트 부족)와 3D-CNN의 한계(높은 계산 비용 및 낮은 해상도)를 극복하기 위해 의미적 장면 복원에서의 성능을 향상시키기 위해.
  • 고해상도 2D 특징과 3D 맥락 추론을 융합하는 종단간 훈련이 가능한 효율적인 프레임워크를 설계하여 정확도와 속도를 향상시키기 위해.
  • 모델 복잡도, 추론 속도, 성능 간의 트레이드오���을 허용하는 융통성 있는 아키텍처를 제공하기 위해.

제안 방법

  • 2D 뷰 컨볼루션 네트워크를 사용하여 입력 깊이 이미지에서 고해상도 기하 특징을 추출한다.
  • 다른 가능한 투영층은 깊이 맵의 공간적 레이아웃을 기반으로 2D 특징 맵을 3D 특징 볼륨으로 매핑한다.
  • 3D 볼륨 컨볼루션 네트워크는 투영된 3D 특징 볼륨을 처리하여 전역적인 3D 맥락을 학습하고 복셀 단위의 점유 및 의미적 레이블을 예측한다.
  • 연쇄적 VVNet는 종단간 훈련이 가능하여 2D 및 3D 특징 학습의 공동 최적화를 가능하게 한다.
  • 다양한 2D 및 3D-CNN 백본을 지원하여 융통성 있는 아키텍처 설계와 하이퍼파rameter 튜닝을 가능하게 한다.
  • 정확도와 효율성의 균형을 맞추기 위해 다양한 해상도 및 깊이 설정을 가진 여러 VVNet 변종(VVNetR-120, VVNetR-60 등)을 평가한다.

실험 결과

연구 질문

  • RQ1하이브리드 2D-3D-CNN 아키텍처가 순수 3D-CNN 방법보다 성능을 뛰어나게 하면서도 계산 비용을 줄일 수 있는가?
  • RQ2고해상도 2D 특징과 3D 맥락을 융합함으로써 가려진 물체의 형태와 의미적 레이블 예측 정확도는 어떻게 향상되는가?
  • RQ32D 백본의 수용장역이 3D 장면 복원 성능에 미치는 영향은 무엇인가?
  • RQ4가변성 있는 투영층이 기하학적 정밀도를 잃지 않고 2D 특징을 3D 공간으로 효과적으로 전달할 수 있는가?
  • RQ5VVNet 프레임워크에서 모델 깊이, 해상도, 추론 속도 간의 트레이드오프는 무엇인가?

주요 결과

  • VVNetR-120은 NYUCAD 데이터셋에서 80.3%의 IoU를 기록하여 SSCNet∗보다 IoU 2.1% 높게 기록했다.
  • SUNCG 데이터셋에서 VVNetR-120은 장면 복원(SC) 작업에서 IoU를 1.4% 향상시키고 의미적 장면 복원(SSC) 작업에서 5.9% 향상시켜 SSCNet∗을 능가했다.
  • VVNetR-120는 훈련 시간을 3배 단축시키고 추론 시간을 7배 이상 단축시키며, 메모리 사용량도 40% 감소시켰다.
  • VVNetR-60 변종은 훈련 시간을 4.7배 빠르게 하고 추론 시간을 10배 이상 빠르게 하였으며, 정확도는 약간 감소하는 데 그쳤다.
  • VVNetR-120의 더 큰 수용장역은 VVNet-120 대비 SC 작업에서 IoU를 1.9% 향상시키고 SSC 작업에서 5.4% 향상시켰다.
  • 3D 볼륨 해상도를 낮추었음에도 불구하고 VVNetR-60는 SSCNet보다 더 높은 정확도를 유지하여 2D-3D 융합 전략의 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.