Skip to main content
QUICK REVIEW

[논문 리뷰] RevealNet: Seeing Behind Objects in RGB-D Scans

Ji Hou, Angela Dai|arXiv (Cornell University)|2019. 04. 26.
Advanced Neural Network Applications참고 문헌 54인용 수 7
한 줄 요약

RevealNet는 부분적인 RGB-D 스캔에서 3D 객체 인스턴스를 동시에 검출하고 완전한 기하학적 구조를 예측하는 새로운 엔드 투 엔드 3D 컨볼루션 신경망을 소개한다. 이는 색상과 기하학적 특징을 모두 활용하여 '물체 뒤를 들여다보는' 능력을 통해 스캔넷에서 mAP@0.5를 15.8 향상시키고, SUNCG에서 18.5 향상시켜 최신 기술 수준을 초월한다.

ABSTRACT

During 3D reconstruction, it is often the case that people cannot scan each individual object from all views, resulting in missing geometry in the captured scan. This missing geometry can be fundamentally limiting for many applications, e.g., a robot needs to know the unseen geometry to perform a precise grasp on an object. Thus, we introduce the task of semantic instance completion: from an incomplete RGB-D scan of a scene, we aim to detect the individual object instances and infer their complete object geometry. This will open up new possibilities for interactions with objects in a scene, for instance for virtual or robotic agents. We tackle this problem by introducing RevealNet, a new data-driven approach that jointly detects object instances and predicts their complete geometry. This enables a semantically meaningful decomposition of a scanned scene into individual, complete 3D objects, including hidden and unobserved object parts. RevealNet is an end-to-end 3D neural network architecture that leverages joint color and geometry feature learning. The fully-convolutional nature of our 3D network enables efficient inference of semantic instance completion for 3D scans at scale of large indoor environments in a single forward pass. We show that predicting complete object geometry improves both 3D detection and instance segmentation performance. We evaluate on both real and synthetic scan benchmark data for the new task, where we outperform state-of-the-art approaches by over 15 in mAP@0.5 on ScanNet, and over 18 in mAP@0.5 on SUNCG.

연구 동기 및 목표

  • 센서 한계로 인해 객체 부분이 가림당하는 불완전한 3D 스캔 문제를 해결한다.
  • 새로운 작업인 의미적 인스턴스 보완을 제안한다: 객체를 검출하고 보이지 않는 영역까지 포함한 전체 3D 기하학적 구조를 추론한다.
  • 로봇 공학, 가상 현실, 스캔 편집 응용 분야에서 더 정확하고 의미 있는 장면 이해를 가능하게 한다.
  • 객체 기하학적 보완과 인스턴스 위치 추정을 함께 학습함으로써 3D 검출 및 인스턴스 세그멘테이션 성능을 향상시킨다.
  • 큰 실내 환경을 단일 전방 계산 단계에서 처리할 수 있는 확장 가능한, 완전히 컨볼루션 기반의 아키텍처를 개발한다.

제안 방법

  • RGB 이미지와 TSDF(절단된 부호 거리 필드) 기하학적 표현을 모두 처리하는 통합 3D CNN 백본을 사용한다.
  • 각 인스턴스별 복셀 점유 맵을 통해 3D 경계 상자, 클래스 레이블, 완전한 객체 기하학적 구조를 엔드 투 엔드로 예측한다.
  • 검출 및 보완 정확도 향상을 위해 색상과 기하학적 특징의 공동 학습을 활용한다.
  • 완전한 객체 형상 예측을 감독하기 위해 기하학적 보완 프록시 손실을 통합한다.
  • 대규모 조밀한 부피 그리드에서 효율적인 추론을 가능하게 하기 위해 완전히 컨볼루션 기반의 설계를 사용한다.
  • 객체 수준의 보완에 대한 진짜값을 제공하기 위해 Scan2CAD 애너테이션을 사용하여 합성 및 실제 스캔 데이터에서 훈련한다.

실험 결과

연구 질문

  • RQ1통합 딥 러닝 모델이 부분적인 RGB-D 스캔에서 3D 객체 인스턴스를 검출하고 완전한 기하학적 구조를 동시에 예측할 수 있는가?
  • RQ2완전한 객체 기하학적 구조를 예측하는 것이 3D 인스턴스 검출 및 세그멘테이션 성능을 향상시키는가?
  • RQ3검출과 보완을 함께 학습하는 방식이 분리된 접근 방식보다 얼마나 효과적인가?
  • RQ4색상 정보를 통합할 경우 의미적 인스턴스 보완 정확도가 얼마나 향상되는가?
  • RQ5전역 기하학적 보완 프록시 손실이 예측된 완전한 객체 형상의 품질에 어떤 영향을 미치는가?

주요 결과

  • 실제 스캔넷 벤치마크에서 RevealNet는 의미적 인스턴스 보완 작업에서 최신 기술 대비 15.8 mAP@0.5 향상 달성.
  • 합성된 SUNCG 데이터셋에서 RevealNet는 기존 방법 대비 18.5 mAP@0.5 향상하여 강력한 일반화 능력 입증.
  • 색상 입력의 포함이 실제 및 합성 스캔 양측에서 보완 성능 향상에 기여하여 다중 모odal 특징 학습의 가치를 입증.
  • 기하학적 보완 프록시 손실이 예측된 완전한 객체 형상의 품질을 크게 향상시켜 후속 검출 및 세그멘테이션 성능 향상.
  • 완전한 객체 기하학적 구조 예측이 3D 인스턴스 세그멘테이션 및 검출 성능에 뚜렷한 향상을 가져오며, 보완이 검출에 영향을 미친다는 것을 보여줌.
  • 완전히 컨볼루션 기반의 설계 덕분에 대규모 3D 스캔에서 효율적이고 단일 패assing 추론이 가능하여 실세계 적용에 대한 확장성 확보.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.