Skip to main content
QUICK REVIEW

[논문 리뷰] Movable-Object-Aware Visual SLAM via Weakly Supervised Semantic Segmentation

Ting Sun, Yuxiang Sun|arXiv (Cornell University)|2019. 06. 09.
Robotics and Sensor-Based Localization참고 문헌 40인용 수 12
한 줄 요약

이 논문은 시각 SLAM에서 동적인 환경에서 이동 가능한 물체를 탐지하기 위해 약한 감독(semi-supervised) 세그멘테이션 방법을 제안한다. 이를 통해 ORB-SLAM2는 이동 가능한 물체를 랜드마크로 사용하는 것을 방지할 수 있다. 이미지 수준의 레이블과 조건부 랜덤 필드(CRF)를 활용한 약한 감독 학습을 통해, 고비용의 픽셀 수준의 애너테이션 없이도 TUM RGB-D 및 KITTI 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Moving objects can greatly jeopardize the performance of a visual simultaneous localization and mapping (vSLAM) system which relies on the static-world assumption. Motion removal have seen successful on solving this problem. Two main streams of solutions are based on either geometry constraints or deep semantic segmentation neural network. The former rely on static majority assumption, and the latter require labor-intensive pixel-wise annotations. In this paper we propose to adopt a novel weakly-supervised semantic segmentation method. The segmentation mask is obtained from a CNN pre-trained with image-level class labels only. Thus, we leverage the power of deep semantic segmentation CNNs, while avoid requiring expensive annotations for training. We integrate our motion removal approach with the ORB-SLAM2 system. Experimental results on the TUM RGB-D and the KITTI stereo datasets demonstrate our superiority over the state-of-the-art.

연구 동기 및 목표

  • 동적인 환경에서 이동 가능한 물체로 인한 시각 SLAM 성능 저하 문제를 해결하기 위해.
  • 정적 물체가 대부분이라는 가정에 의존하거나 고비용의 픽셀 수준 애너테이션을 요구하는 전통적 운동 제거 방법의 한계를 극복하기 위해.
  • 최소한의 감독으로도 실용적이고 적응 가능한 딥러닝 기반의 동적 환경 SLAM 솔루션을 개발하기 위해.
  • 약한 감독 세그멘테이션을 ORB-SLAM2에 통합하여 기능점이 이동 가능한 물체 영역에 할당되는 것을 방지하기 위해.
  • 도시 주행 및 실내 탐색과 같은 실제 시나리오에서 장기적인 데이터 연관성과 강건성을 향상시키기 위해.

제안 방법

  • 이미지 수준의 클래스 레이블만을 사용하여 사전 학습된 딥 컨volution 네트워크를 활용해 약한 감독 세그멘테이션을 수행한다.
  • 粗모양의 세그멘테이션 출력을 정밀한 픽셀 수준 마스크로 개선하기 위해 조건부 랜덤 필드(CRF)를 적용한다.
  • 사전 정의된 이동 가능한 물체 카테고리(예: 차량, 사람 등)에 속하는 모든 픽셀을 식별하는 이진 마스크를 구축한다.
  • 이진 마스크를 ORB-SLAM2의 트래킹 모듈에 통합하여 이동 가능한 물체 영역에서 기능점 할당을 억제한다.
  • 가용한 경우 깊이 정보를 CRF 개선 과정에 통합하여 마스크 정확도를 향상시킨다.
  • 전면 기능 관리 로직만 수정함으로써 표준 ORB-SLAM2와의 호환성을 유지한다.

실험 결과

연구 질문

  • RQ1약한 감독 세그멘테이션을 통해 픽셀 수준의 애너테이션 없이도 동적 환경에서 이동 가능한 물체를 효과적으로 탐지할 수 있는가?
  • RQ2약한 감독 세그멘테이션의 통합이 ORB-SLAM2의 동적 환경에서의 강건성에 어떤 영향을 미치는가?
  • RQ3CRF 개선 과정에 깊이 정보를 통합할 경우, 운동 인식 SLAM을 위한 세그멘테이션 정확도는 어느 정도 향상되는가?
  • RQ4기존 최신 기술 수준의 접근 방식과 비교해 본다면, 제안된 방법은 벤치마크 데이터셋에서 정위치 측정 정확도와 강건성 측면에서 승리하는가?
  • RQ5고밀도의 이동 가능한 물체가 존재하는 상황에서도 성능을 유지할 수 있으며, 단기 트래킹과 장기 루프 클로징 정확도를 유지할 수 있는가?

주요 결과

  • TUM RGB-D 데이터셋에서, 제안된 방법은 ORB-SLAM2 대비 시퀀스 06에서 이동 거리 오차(RPE RMSE)를 31.01% 향상시켰다.
  • KITTI 스테레오 데이터셋에서, 시퀀스 09에서 절대 궤적 오차(ATE)가 49.17% 향상되어 기준선을 크게 능가했다.
  • KITTI 데이터셋의 10개 시퀀스 중 6개에서 최신 기술 수준의 성능을 달성하였으며, 특히 시퀀스 06, 07, 09에서 두드러진 성과를 보였다.
  • CRF 개선 과정에 깊이 정보를 활용함으로써 세그멘테이션 품질이 향상되어, 더 나은 운동 인식 SLAM 성능을 달성했다.
  • 높은 동적 물체 존재 조건에서도 장기 루프 클로징에서 강건성을 유지하였으며, 데이터 연관성에서의 잘못된 양성 결과(false positives)를 감소시켰다.
  • 세그멘테이션의 평균 추론 시간은 1.27초/이미지로, 중간 속도 응용 분야에서 실시간 배포 가능성은 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.