Skip to main content
QUICK REVIEW

[논문 리뷰] Dense RGB-D semantic mapping with Pixel-Voxel neural network

Cheng Zhao, Li Sun|arXiv (Cornell University)|2017. 09. 30.
Robotics and Sensor-Based Localization참고 문헌 23인용 수 4
한 줄 요약

이 논문은 RGB 이미지의 글로벌 컨텍스트와 3D 포인트 클라우드의 로컬 기하학적 구조를 동시에 활용하는 픽셀-복셀 신경망을 사용하여 실시간 밀도 높은 RGB-D 세분화 맵핑 시스템을 제안한다. 신뢰도 기반으로 PixelNet과 VoxelNet의 예측를 적응적으로 융합하기 위해 소프트맥스 가중 융합 스택을 도입함으로써, SUN RGB-D 벤치마크에서 최신 기술 수준의 성능을 달성하며, 표준 PC에 Titan X GPU를 탑재한 경우 11–12 Hz로 실행된다.

ABSTRACT

For intelligent robotics applications, extending 3D mapping to 3D semantic mapping enables robots to, not only localize themselves with respect to the scene's geometrical features but also simultaneously understand the higher level meaning of the scene contexts. Most previous methods focus on geometric 3D reconstruction and scene understanding independently notwithstanding the fact that joint estimation can boost the accuracy of the semantic mapping. In this paper, a dense RGB-D semantic mapping system with a Pixel-Voxel network is proposed, which can perform dense 3D mapping while simultaneously recognizing and semantically labelling each point in the 3D map. The proposed Pixel-Voxel network obtains global context information by using PixelNet to exploit the RGB image and meanwhile, preserves accurate local shape information by using VoxelNet to exploit the corresponding 3D point cloud. Unlike the existing architecture that fuses score maps from different models with equal weights, we proposed a Softmax weighted fusion stack that adaptively learns the varying contributions of PixelNet and VoxelNet, and fuses the score maps of the two models according to their respective confidence levels. The proposed Pixel-Voxel network achieves the state-of-the-art semantic segmentation performance on the SUN RGB-D benchmark dataset. The runtime of the proposed system can be boosted to 11-12Hz, enabling near to real-time performance using an i7 8-cores PC with Titan X GPU.

연구 동기 및 목표

  • 로봇 응용 분야에서 세분화 이해와 기하학적 재구성을 통합함으로써 실시간 밀도 높은 3D 세분화 맵핑을 가능하게 한다.
  • 기존 방법들이 3D 재구성과 세분화 분할을 별도로 처리함으로써 정확도가 저하되는 한계를 해결한다.
  • RGB 이미지(글로벌 컨텍스트)와 3D 포인트 클라우드(로컬 형태 세부 정보)의 이점을 동시에 활용하여 개선된 세분화 정확도를 달성하기 위한 공동 학습 프레임워크를 개발한다.
  • 신뢰도 수준에 따라 다양한 네트워크의 예측에 동적으로 가중치를 적용하는 학습 가능한 융합 메커니즘을 설계한다.
  • 표준 하드웨어를 사용하여 실시간 성능(11–12 Hz)을 달성하고, 실질적인 로봇 배포에 적합한 근접 실시간 성능을 확보한다.

제안 방법

  • 픽셀-복셀 네트워크는 두 개의 병렬 브랜치로 구성되며, PixelNet은 다중 스케일의 글로벌 컨텍스트를 추출하기 위해 확장된 컨볼루션을 반복 적용하여 RGB 이미지를 처리한다.
  • VoxelNet은 3D 포인트 클라우드를 3D 격자로 변환하고, 풀링을 사용하지 않음으로써 국소 기하학적 세부 정보를 유지하면서 3D 컨볼루션 레이어를 적용한다.
  • 소프트맥스 가중 융합 스택은 각 네트워크 출력의 신뢰도 기반 가중치를 학습하여 PixelNet과 VoxelNet의 스코어 매핑을 적응적으로 융합한다.
  • 이 융합 메커니즘은 미분 가능하며, 다양한 네트워크 아키텍처에 삽입되어 다중 입력 모odal리티 스트림을 갖는 엔드 투 엔드 학습을 가능하게 한다.
  • 시스템은 RGB-D SLAM과 통합되어 시각적 오도메트리와 복소체의 레이블에 대한 재귀적 베이지안 정밀 조정을 통해 점진적으로 밀도 높은 3D 세분화 맵을 구축한다.
  • 네트워크는 Caffe를 사용하여 CUDA 및 cuDNN 가속을 통해 SUN RGB-D 데이터셋에서 훈련되며, 실시간 성능 확보를 위해 반복 해상도 입력을 최적화하여 추론을 수행한다.

실험 결과

연구 질문

  • RQ1RGB 이미지와 3D 포인트 클라우드에서의 공동 학습이 독립적 처리에 비해 세분화 정확도를 향상시킬 수 있는가?
  • RQ2RGB 이미지(글로벌 컨텍스트)와 3D 포인트 클라우드(로컬 기하학)의 상호보완적 강점을 딥 러닝 프레임워크 내에서 효과적으로 융합할 수 있는가?
  • RQ3학습 가능한, 신뢰도 기반 융합 메커니즘이 고정 가중치 융합보다 다중 모odal 세분화에서 더 우수한 성능을 낼 수 있는가?
  • RQ4표준 데스크톱 하드웨어에서 공동 RGB-D 네트워크를 사용하여 실시간 밀도 높은 3D 세분화 맵핑(11–12 Hz)을 달성하는 것이 가능한가?
  • RQ5실제 환경 데이터에서 시스템은 SUN RGB-D 벤치마크 성능과 비교해 어떻게 작동하는가? 일반화에 영향을 주는 요소는 무엇인가?

주요 결과

  • 픽셀-복셀 네트워크는 VGG16를 사용할 경우 mIoU 68.77%, ResNet101을 사용할 경우 mIoU 72.47%로 SUN RGB-D 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • 소프트맥스 가중 융합 스택은 각 네트워크의 신뢰도 기반으로 기여도를 동적으로 조정함으로써 등가 가중 융합보다 성능을 향상시킨다.
  • 반복 해상도 입력을 사용할 경우 i7 8코어 CPU와 Titan X GPU를 탑재한 표준 PC에서 11–12 Hz로 실행되어 근접 실시간 요구사항을 충족한다.
  • 실제 생활실 및 침실 환경의 질적 결과에서 정확한 경계 형태를 갖는 밀도 높은 3D 세분화 맵을 생성한다.
  • 강력한 성능에도 불구하고, 조도 변화, 합성된 SUN RGB-D 데이터에서의 도메인 이탈, 센서 노이즈로 인해 일부 오류가 발생한다.
  • 핵심 프레임만 처리하고 반복 해상도 입력을 사용함으로써 런타임을 11–12 Hz로 향상시킬 수 있어 속도와 정확도 사이의 타당한 트레이드오프를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.