Skip to main content
QUICK REVIEW

[논문 리뷰] Fusion++: Volumetric Object-Level SLAM

John McCormac, Ronald Clark|arXiv (Cornell University)|2018. 08. 25.
Robotics and Sensor-Based Localization참고 문헌 38인용 수 15
한 줄 요약

Fusion++는 개별 물체의 Truncated Signed Distance Functions (TSDF)를 사용하여 지속적이고 글로벌 일관성 있는 3D 지ap을 구축하는 온라인, 물체 수준의 SLAM 시스템을 제안한다. 이 시스템은 크기에 따라 해상도가 조절되는 TSDF와 3D 포어그라운드 마스크를 활용하여 실시간 성능(4–8 Hz)을 달성한다. 이를 위해 물체 인스턴스의 자세 그래프를 유지함으로써 내재적 물체 왜곡 없이 루프 클로징을 가능하게 하며, 다양한 물체가 존재하는 혼잡한 실내 환경에서 높은 재구성 품질과 메모리 효율성을 입증한다.

ABSTRACT

We propose an online object-level SLAM system which builds a persistent and accurate 3D graph map of arbitrary reconstructed objects. As an RGB-D camera browses a cluttered indoor scene, Mask-RCNN instance segmentations are used to initialise compact per-object Truncated Signed Distance Function (TSDF) reconstructions with object size-dependent resolutions and a novel 3D foreground mask. Reconstructed objects are stored in an optimisable 6DoF pose graph which is our only persistent map representation. Objects are incrementally refined via depth fusion, and are used for tracking, relocalisation and loop closure detection. Loop closures cause adjustments in the relative pose estimates of object instances, but no intra-object warping. Each object also carries semantic information which is refined over time and an existence probability to account for spurious instance predictions. We demonstrate our approach on a hand-held RGB-D sequence from a cluttered office scene with a large number and variety of object instances, highlighting how the system closes loops and makes good use of existing objects on repeated loops. We quantitatively evaluate the trajectory error of our system against a baseline approach on the RGB-D SLAM benchmark, and qualitatively compare reconstruction quality of discovered objects on the YCB video dataset. Performance evaluation shows our approach is highly memory efficient and runs online at 4-8Hz (excluding relocalisation) despite not being optimised at the software level.

연구 동기 및 목표

  • 밀도 있는 장면 기하학이 아닌 개별 물체의 재구성과 추적에 중점을 둔 온라인, 지속 가능한 3D SLAM 시스템을 개발하는 것.
  • 혼잡한 실내 환경에서 사전에 알려지지 않은 임의의 물체 인스턴스에 대해 정확하고 글로벌 일관성 있는 3D 재구성을 유지하는 과제를 해결하는 것.
  • 단일 큰 TSDF 볼륨 대신 크기에 따라 해상도가 조절되는 컴act한 개별 물체 TSDF 볼륨을 사용하여 메모리 효율성과 확장성을 향상시키는 것.
  • 내재적 물체 왜곡 없이 루프 클로징을 가능하게 하기 위해 물체 인스턴스의 자세 그래프를 사용하여 견고한 추적, 재정렬 및 루프 클로징을 구현하는 것.

제안 방법

  • 실시간 2D 인스턴스 세그멘테이션을 위해 Mask R-CNN을 사용하여 크기에 따라 해상도가 조절되는 개별 물체 TSDF 재구성을 초기화한다.
  • 새로운 3D 바vox 마스크를 적용하여 검출된 인스턴스의 포어그라운드만 TSDF에 융합함으로써 재구성 정밀도를 향상시키고 배경 융합에 의한 노이즈를 감소시킨다.
  • 유일한 지도 표현으로 개별 물체 인스턴스의 지속적인 6DoF 자세 그래프를 유지하여, 루프 클로징을 통한 글로벌 일관성을 달성한다.
  • TSDF 융합을 통해 깊이 데이터를 점진적으로 통합함으로써 시간이 지남에 따라 물체 기하학을 정밀하게 개선하면서도 의미적 레이블과 존재 확률을 유지한다.
  • 추적 및 음영 처리 모델링을 위해 개별적으로 분리된 일시적인 로컬 TSDF를 사용하여 지속적인 물체 지도와 분리한다.
  • 거짓 탐지 처리를 위해 각 물체에 존재 확률을 도입하고, 장기간에 걸쳐 잘못된 양성 결과를 관리하기 위한 삭제 메커니즘을 구현한다.

실험 결과

연구 질문

  • RQ1RGB-D 입력만을 사용하여 혼잡한 실내 환경에서 사전에 알려지지 않은 임의의 물체 인스턴스에 대해 고해상도이고 의미적으로 레이블이 부여된 3D 재구성을 유지할 수 있는가?
  • RQ2물체 수준의 SLAM은 개별 물체 재구성의 왜곡 없이 글로벌 일관성과 루프 클로징을 어떻게 달성할 수 있는가?
  • RQ3단일 밀도 TSDF 대비 개별 물체에 대해 가변 해상도 TSDF를 사용할 경우, 메모리 효율성과 재구성 품질 사이의 상호 교환 관계는 어떠한가?
  • RQ4시스템은 장기간의 시퀀스 동안 탐지 오류와 거짓 인스턴스 예측을 어떻게 처리하는가?
  • RQ5물체 인스턴스 수가 증가함에 따라 런타임과 메모리 사용량 측면에서 효율적으로 확장 가능한가?

주요 결과

  • 혼잡한 사무실 시퀀스(105개 물체 포함)에서 Fusion++는 재정렬 및 그래프 최적화를 제외한 평균 4–8 Hz의 프레임 레이트를 달성하여 실시간 가능성과 타당성을 입증한다.
  • RGB-D SLAM 벤치마크에서 Fusion++는 기준 TSDF 오도메트리에 비해 fr2_desk 시퀀스에서 절대 궤적 오차(Absolute Trajectory Error, ATE RMSE)를 최대 66% 감소시켰다(0.342 m → 0.114 m).
  • 105개 물체에 대해 GPU 메모리 사용량이 오직 377 MB이며, 평균 물체당 약 4 MB로, 개별 물체의 크기에 따라 해상도가 조절되는 TSDF 덕분에 높은 메모리 효율성을 보였다.
  • 기본 방법 대비 물체 재구성이 정성적으로 뛰어나며, 포어그라운드 세부 정보가 잘 유지되고 자세 그래프의 드리프트가 최소화되었다.
  • 자세 그래프 최적화가 성공적으로 루프를 클로즈하여 개별 물체 기하학을 왜곡하지 않고 물체 간 상대 자세를 조정하였다.
  • 물체 수 증가에 따라 시스템이 잘 확장되었으며, 평균적으로 보이는 물체당 약 1ms의 계산 시간만 추가되었고, 런타임 구성 요소에서 선형 확장성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.