Skip to main content
QUICK REVIEW

[논문 리뷰] 3D-SIS: 3D Semantic Instance Segmentation of RGB-D Scans

Ji Hou, Angela Dai|arXiv (Cornell University)|2018. 12. 17.
Image and Object Detection Techniques참고 문헌 39인용 수 21
한 줄 요약

3D-SIS는 자세가 정렬된 다중 시야 입력을 통해 2D RGB 특징과 3D 기하학적 특징을 공동으로 융합함으로써 RGB-D 스캔에서 3D 의미적 인스턴스 세분화를 위한 새로운 엔드 투 엔드 딥 러닝 프레임워크를 제안한다. 이 방법은 전체 3D 환경에서 단일 스텝 추론을 가능하게 하는 완전 컨볼루션 아키텍처를 통해 실세계 ScanNetV2 벤치마크에서 mAP를 13점 이상 향상시켜 최신 기술 수준을 확보한다.

ABSTRACT

We introduce 3D-SIS, a novel neural network architecture for 3D semantic instance segmentation in commodity RGB-D scans. The core idea of our method is to jointly learn from both geometric and color signal, thus enabling accurate instance predictions. Rather than operate solely on 2D frames, we observe that most computer vision applications have multi-view RGB-D input available, which we leverage to construct an approach for 3D instance segmentation that effectively fuses together these multi-modal inputs. Our network leverages high-resolution RGB input by associating 2D images with the volumetric grid based on the pose alignment of the 3D reconstruction. For each image, we first extract 2D features for each pixel with a series of 2D convolutions; we then backproject the resulting feature vector to the associated voxel in the 3D grid. This combination of 2D and 3D feature learning allows significantly higher accuracy object detection and instance segmentation than state-of-the-art alternatives. We show results on both synthetic and real-world public benchmarks, achieving an improvement in mAP of over 13 on real-world data.

연구 동기 및 목표

  • 단일 이미지 방법이 공간 일관성을 포착하지 못하는 실세계 RGB-D 스캔에서 3D 의미적 인스턴스 세분화의 과제를 해결한다.
  • 일반 소자(예: Kinect)에서 얻은 상용 다중 시야 RGB-D 입력을 활용하여 3D 객체 검출 및 인스턴스 세분화 정확도를 향상시킨다.
  • 대규모 3D 환경에서 효율적인 단일 스텝 추론을 가능하게 하는 완전 컨볼루션 3D 네트워크를 개발한다.
  • 자세가 정렬된 특징 융합을 통해 색상(RGB)과 기하학적(서명된 거리 필드) 신호를 공동으로 학습한다.
  • 2D 인스턴스 세분화 모델(예: Mask R-CNN)을 3D로 투영했을 때의 한계를 극복하기 위해 3D 공간적 맥락을 통합한다.

제안 방법

  • 6DoF 자세가 알려진 다중 시야 RGB-D 시퀀스를 사용하여 서명된 거리 필드를 통해 3D 체적 격자 재구성한다.
  • 각 RGB 프레임에서 2D 컨볼루션을 통해 2D 특징을 추출한 후, 자세 정렬을 통해 이를 3D 바vox 격자로 역투영한다.
  • 3D 컨볼루션과 잔차 블록을 사용하여 공통 3D 특징 공간에서 2D 색상 특징과 3D 기하학적 특징을 융합한다.
  • 객체 제안을 위해 3D 영역 제안 네트워크(3D-RPN)와 3D RoI 풀링 레이어를 활용하여 경계 상자, 클래스 레이블, 및 픽셀 단위 인스턴스 마스크를 생성한다.
  • 경계 상자 회귀, 객체 분류, 의미적 인스턴스 마스크 예측을 위한 병합 손실을 사용하여 전체 네트워크를 엔드 투 엔드로 훈련한다.
  • 완전 컨볼루션 아키텍처를 사용하여 패치나 자르기 없이 전체 3D 스캔에서 효율적인 단일 스텝 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ12D RGB와 3D 기하학적 특징을 공동으로 학습함으로써 단일 모odal 기반 방법보다 3D 인스턴스 세분화 정확도가 향상되는가?
  • RQ2자세 정렬을 통한 다중 시야 RGB-D 입력을 활용할 경우 3D 인스턴스 세분화에서 공간 일관성과 성능이 향상되는가?
  • RQ3완전 컨볼루션 3D 네트워크가 대규모 3D 환경에서 높은 정확도로 단일 스텝 추론을 수행할 수 있는가?
  • RQ4입력 시야 수(1, 3, 5)가 실세계 및 시뮬레이션 환경에서 3D 인스턴스 세분화 성능에 미치는 영향은 어떠한가?
  • RQ5기준 데이터셋에서 2D 기반 모델(예: Mask R-CNN)을 3D 공간으로 투영했을 때 3D-SIS는 어느 정도 성능을 뛰어넘는가?

주요 결과

  • 실세계 ScanNetV2 데이터셋에서 3D-SIS는 최신 기술 수준의 방법보다 mAP를 13.5점 향상시켰으며, 다섯 시야를 사용할 경우 최종 mAP@0.5는 40.2에 도달한다.
  • 시뮬레이션된 SUNCG 데이터셋에서 3D-SIS는 mAP@0.25 32.2, mAP@0.5 24.7을 기록하여 이전 방법들인 Frustum PointNet 및 3D로 투영된 Mask R-CNN를 능가한다.
  • 제거 분석 결과, 시야 수를 1에서 5로 늘일수록 성능이 일관되게 향상되며, ScanNetV2에서 mAP@0.5는 18.7에서 22.5로 증가한다.
  • 기하학적 특징만을 사용해 훈련한 모델(geo only)은 ScanNetV2에서 mAP@0.5 27.6을 달성하지만, RGB 특징을 추가하면 성능이 크게 향상된다.
  • 완전 컨볼루션 아키텍처 덕분에 전체 3D 스캔에서 단일 스텝 추론이 가능하여 실시간 및 대규모 응용에 적합하다.
  • 3D-SIS는 ScanNetV2 3D 인스턴스 세분화 벤치마크에서 MTML, 3D-BEVIS, R-PointNet과 같은 동시대 최고 기술 수준의 방법들을 모두 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.