[논문 리뷰] DROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D Cameras
DROID-SLAM은 Dense Bundle Adjustment 계층을 사용하여 카메라 포즈와 픽셀 단위 깊이를 공동으로 업데이트하는 differentiable recurrent optimization SLAM 시스템을 도입하여 retraining 없이 단안, 스테레오, RGB-D 입력에서 최첨단 정확도와 견고성을 달성합니다.
We introduce DROID-SLAM, a new deep learning based SLAM system. DROID-SLAM consists of recurrent iterative updates of camera pose and pixelwise depth through a Dense Bundle Adjustment layer. DROID-SLAM is accurate, achieving large improvements over prior work, and robust, suffering from substantially fewer catastrophic failures. Despite training on monocular video, it can leverage stereo or RGB-D video to achieve improved performance at test time. The URL to our open source code is https://github.com/princeton-vl/DROID-SLAM.
연구 동기 및 목표
- 단안, 스테레오, RGB-D 모듈 전반에서 강건하고 정확한 비주얼 SLAM을 동기화하기 위해.
- 포즈와 밀집 깊이를 함께 최적화하는 딥러닝 SLAM 프레임워크를 개발한다.
- 모노큘러 학습이 스테레오 및 RGB-D 테스트에 일반화되도록 교차 모달 일반화를 가능하게 한다.
- 전통 기하학과 학습된 업데이트를 융합하기 위한 differentiable DBA 계층을 도입한다.
제안 방법
- 카메라 포즈와 역 깊이에 대한 순환 업데이트 반복이 있는 엔드-투-엔드 차별화 가능한 파이프라인을 사용한다.
- covisible 프레임을 캡처하는 프레임 그래프로 문제를 표현하고 3x3 ConvGRU로 업데이트를 수행한다.
- RAFT에서 영감을 받은 상관 피라미드를 사용하여 이미지 쌍으로부터 밀집 대응 및 상관 특징을 계산한다.
- 플로우 수정과 신뢰도 맵을 예측한 다음, pose와 depth 업데이트를 얻기 위해 differentiable Dense Bundle Adjustment를 적용한다.
- 포즈와 플로우 감독으로 학습하고, 모노큘러 학습에서 처음 두 포즈를 앵커링하여 게이지 자유도를 고정한다.
- 필요에 따라 DBA 계층을 조정하고 깊이 측정을 포함시켜 스테레오 및 RGB-D로 확장한다.
실험 결과
연구 질문
- RQ1단안, 스테레오, RGB-D 입력에서 높은 정확도를 달성하면서 강건성을 유지하는 딥러닝 SLAM 시스템이 가능할까?
- RQ2반복적이고 차별화 가능한 최적화(DROID)가 여러 프레임에 걸쳐 카메라 포즈와 밀집 깊이를 공동으로 정제할 수 있을까?
- RQ3밀집 번들 조정 계층을 도입하면 정확도와 실패율이 기존 SLAM 접근법에 비해 어떻게 달라지는가?
- RQ4단안에서 학습된 모델이 재학습 없이 스테레오 및 RGB-D 테스트에 어느 정도 일반화할 수 있는가?
- RQ5실시간 엔드-투-엔드 딥 SLAM 시스템의 표준 벤치마크에서 속도, 메모리 같은 성능 특성은 어떠한가?
주요 결과
- 여러 데이터셋 및 모달리티에서 최첨단 정확도를 달성하며, 이전 연구 대비 큰 상대적 개선이 관찰된다.
- ETH-3D, TartanAir, EuRoC, TUM-RGBD 등 데이터셋에서 재앙적 실패가 현저히 적어 높은 견고성을 보인다.
- 단안 데이터로만 학습한 모델이 테스트 시 스테레오나 RGB-D 입력을 효과적으로 활용할 수 있어 일반화가 강하다.
- TartanAir 단안에서 이전 최적 대비 62%의 오차 감소; 스테레오에서 60% 감소.
- ETH-3D RGB-D에서 AUC 1위로 랭크되며 30/32 RGB-D 데이터셋을 추적하는 등 차별화된 우수 성능을 보인다.
- Euroc, TUM-RGBD, ETH-3D 벤치마크에서 클래식 SLAM 기법과 다수의 딥러닝 경쟁자들을 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.