Skip to main content
QUICK REVIEW

[논문 리뷰] RGB-D-Inertial SLAM in Indoor Dynamic Environments with Long-term Large Occlusion

Ran Long, Christian Rauch|arXiv (Cornell University)|2023. 03. 23.
Robotics and Sensor-Based Localization인용 수 4
한 줄 요약

이 논문은 카메라를 동시에 추적하고, 동적 물체를 클러스터 단위로 조밀하게 분할하며, 병합된 희소 및 조밀한 특징을 사용하여 희소한 정적 지도를 유지하는 강건한 RGB-D-자이로스코픽 SLAM 시스템을 제안한다. 장기간의 큰 가림을 겪는 상황에서도 기존 최고 수준의 방법들보다 우수한 성능을 보이며, 위치 추정, 동적 물체 분할, 배경 재구성 측면에서 뛰어난 성능을 발휘한다.

ABSTRACT

This work presents a novel RGB-D-inertial dynamic SLAM method that can enable accurate localisation when the majority of the camera view is occluded by multiple dynamic objects over a long period of time. Most dynamic SLAM approaches either remove dynamic objects as outliers when they account for a minor proportion of the visual input, or detect dynamic objects using semantic segmentation before camera tracking. Therefore, dynamic objects that cause large occlusions are difficult to detect without prior information. The remaining visual information from the static background is also not enough to support localisation when large occlusion lasts for a long period. To overcome these problems, our framework presents a robust visual-inertial bundle adjustment that simultaneously tracks camera, estimates cluster-wise dense segmentation of dynamic objects and maintains a static sparse map by combining dense and sparse features. The experiment results demonstrate that our method achieves promising localisation and object segmentation performance compared to other state-of-the-art methods in the scenario of long-term large occlusion.

연구 동기 및 목표

  • 장기간에 걸쳐 다수의 동적 물체에 의해 카메라 시야의 대부분이 가려지는 상황에서 정확한 카메라 위치 추정 문제를 해결한다.
  • 기존의 동적 SLAM 방법들이 동적 물체가 장면를 지배할 경우 의미적 분할이나 이방치 제거를 통해 감지하지 못할 때 실패하는 한계를 극복한다.
  • 카메라 자세, 동적 물체 분할, 정적 지도 재구성 등을 동시에 추정하는 견고한 비틀림-결합된 번들 조정을 통해 자이로스코픽 측정값에서의 운동 사전 지식을 통합함으로써 강력한 시각-자이로스코픽 SLAM을 실현한다.
  • 동적 영역에서의 지도 포인트를 능동적으로 제거하고, 희소한 정적 지도를 희소 및 조밀한 특징을 모두 활용하여 유지함으로써 장기적인 내성 강도를 향상시킨다.
  • 추정된 카메라 궤적과 동적 물체 분할을 기반으로 전체 시퀀스 처리 후 조밀한 배경 재구성을 정확하게 수행한다.

제안 방법

  • 카메라 자세, 자이로스코픽 측정값의 편향, 조밀한 동적 물체 분할, 희소한 정적 지도 포인트를 동시에 최적화하는 견고한 비틀림-결합된 시각-자이로스코픽 번들 조정을 제안한다.
  • 장기간의 큰 가림 상황에서의 강성 향상을 위해 키프레임에서 유도된 희소 특징과 RGB-D 입력에서 유도된 조밀한 특징을 모두 통합한다.
  • 정적 배경 특징이 부족한 상황에서 특히 유용한, 자이로스코픽 센서에서 유도된 운동 사전 지식을 활용하여 큰 가림을 유발하는 동적 물체를 보다 정확히 탐지한다.
  • 시간이 지남에 따라 여러 동적 물체를 정적 배경에서 분리하는 데 효과적인 클러스터 단위의 조밀한 분할 기법을 적용한다.
  • 동적 영역와 관련된 지도 포인트를 능동적으로 제거함으로써 동적 영역에서의 장기적인 가림 동안에도 지도 일관성을 확보하는 희소한 정적 지도를 유지한다.
  • 추정된 카메라 궤적과 조밀한 분할 결과를 기반으로 후처리 단계에서 조밀한 배경 재구성을 수행하여 정확한 정적 환경 모델링을 가능하게 한다.

실험 결과

연구 질문

  • RQ1카메라 시야의 대부분이 장기간에 걸쳐 여러 동적 물체에 의해 가려지는 상황에서도 시각-자이로스코픽 SLAM 시스템이 정확한 카메라 위치 추정을 유지할 수 있는가?
  • RQ2기존의 의미적 지식이나 우세한 정적 배경 특징이 없는 상황에서 동적 물체를 효과적으로 탐지하고 분할할 수 있는가?
  • RQ3기존 방법들과 비교해 병합된 희소 및 조밀한 특징이 장기적인 큰 가림 상황에서 강성 향상에 얼마나 기여하는가?
  • RQ4엄격하게 결합된 번들 조정 프레임워크가 심각한 가림 상황에서도 카메라 운동, 동적 물체 분할, 정적 지도 재구성 등을 동시에 추정할 수 있는가?
  • RQ5정위치 추정 정확도, 동적 분할, 배경 재구성 측면에서 제안된 방법은 최고 수준의 SLAM 시스템들과 비교해 어떻게 성능가능한가?

주요 결과

  • 제안된 방법은 장기간의 큰 가림 시퀀스(LTLO)에서 기존 최고 수준의 방법들보다 뛰어난 정위치 추정 정확도를 확보하였으며, 특히 40초 이상 지속되는 장기적인 가림이 발생하는 시퀀스에서 두드러진 성능을 보였다.
  • 동적 물체 분할 측면에서, 오직 제안된 방법만이 LTLO 시퀀스(seq7)의 모든 프레임에서 일관되고 정확한 클러스터 단위의 조밀한 분할 결과를 제공하였으며, SF, CF, PF는 실패하거나 일관성 없는 결과를 보였다.
  • 배경 재구성 측면에서 StaticFusion(SF)과 Co-Fusion(CF)을 초월하여 성능을 발휘하였으며, SF는 동적 물체를 정적 모델에 잘못 매핑하였고, CF는 불완전한 분할 결과를 생성하였다.
  • PlanarFusion(PF)는 SF 및 CF보다 더 나은 분할 성능를 보였지만, 동적 물체 제거 후 정위치 추정의 일관성이 유지되지 않아 재구성 과정에서 정적 물체가 이격되는 문제가 발생하였다.
  • 절단 실험 결과, 루프 클로징 스레드를 비활성화할 경우 정위치 추정 정밀도가 떨어짐을 확인하여, 동적 물체 제거가 장기적인 가림 상황에서 강성 향상에 중대한 기여를 한다는 점을 입증하였다.
  • 추정된 궤적과 분할 결과를 기반으로 한 조밀한 배경 재구성 결과는 정답 데이터와 매우 유사하게 나타나, 후처리 재구성 파이프라인의 효과성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.