[논문 리뷰] DytanVO: Joint Refinement of Visual Odometry and Motion Segmentation in Dynamic Environments
DytanVO는 동적인 환경에서 카메라 자가 운동과 운동 세그멘테이션을 반복적으로 개선함으로써 공동으로 보정하는 지도 학습 기반 시각 온도메트리 시스템이다. 실제 동적 데이터셋에서 최신의 VO 방법보다 평균 27.7% 향상된 ATE 성능을 달성하며, 미세조정 없이도 백엔드 최적화된 SLAM 시스템조차도 능가한다.
Learning-based visual odometry (VO) algorithms achieve remarkable performance on common static scenes, benefiting from high-capacity models and massive annotated data, but tend to fail in dynamic, populated environments. Semantic segmentation is largely used to discard dynamic associations before estimating camera motions but at the cost of discarding static features and is hard to scale up to unseen categories. In this paper, we leverage the mutual dependence between camera ego-motion and motion segmentation and show that both can be jointly refined in a single learning-based framework. In particular, we present DytanVO, the first supervised learning-based VO method that deals with dynamic environments. It takes two consecutive monocular frames in real-time and predicts camera ego-motion in an iterative fashion. Our method achieves an average improvement of 27.7% in ATE over state-of-the-art VO solutions in real-world dynamic environments, and even performs competitively among dynamic visual SLAM systems which optimize the trajectory on the backend. Experiments on plentiful unseen environments also demonstrate our method's generalizability.
연구 동기 및 목표
- 움직이는 물체가 자가 운동 추정을 방해하는 동적인 환경에서 학습 기반 VO의 한계를 해결하기 위해.
- 동적 물체 제거에 대해 세분화 분류에 의존하는 것의 문제점을 해결하기 위해, 이는 알려지지 않은 카테고리에서는 실패하고 정적 물체를 이동 가능한 것으로 오해할 수 있다.
- 자기 운동 추정과 운동 세그멘테이션 간 상호의존성을 지도 학습 프레임워크 내에서 공동 최적화를 통해 활용하기 위해.
- 백엔드 경로 최적화 없이도 실시간으로 작동하고 끝에서 끝까지 학습 가능한 시스템을 개발하여, 매우 동적인 장면에서의 강인성을 향상시키기 위해.
- 알려지지 않은 환경으로의 일반화 능력과 급격한 카메라 운동 및 높은 동적 물체 밀도 하에서의 강인성을 입증하기 위해.
제안 방법
- 프레임워크는 세 단계 아키텍처를 사용한다: 초도 광학 흐름 추정을 위한 매칭 네트워크, 자가 운동 예측을 위한 포즈 네트워크, 동적 영역 분류를 위한 운동 세그멘테이션 네트워크.
- 각 반복 개선 단계에서 동적 영역에 대한 마스크가 적용된 영역 내 광학 흐름은 0으로 설정되어 운동 효과를 분리한다.
- 포즈 및 세그멘테이션 네트워크는 다중 반복을 통해 반복적으로 개선되며, 실시간 성능 유지를 위해 매칭 네트워크는 오직 한 번만 실행된다.
- 합성 데이터를 사용해 지도 학습 방식으로 학습함으로써, 미세조정 없이도 실제 동적 장면으로의 일반화가 가능하다.
- 반복적 개선은 실시간 제약 조건 하에서 자가 운동과 운동 세그멘테이션 모두가 신속하게 수렴하도록 한다.
- 자기 운동 보정 후 잔여 광학 흐름을 기반으로 동적 물체 마스크를 업데이트함으로써 반복 과정에서 세그멘테이션 정확도를 향상시킨다.
실험 결과
연구 질문
- RQ1자기 운동과 운동 세그멘테이션의 공동 개선이 동적인 시각 온도메트리 성능 향상에 기여하는가?
- RQ2지각 학습 접근 방식이 자가 지도 학습 또는 비지도 학습 방법보다 알려지지 않은 동적 환경으로의 일반화 능력에서 뛰어나지 않는가?
- RQ3포즈 및 세그멘테이션의 반복적 개선이 실시간 배포에 충분히 신속하게 수렴할 수 있는가?
- RQ4매우 동적인 장면에서 최신의 VO 및 SLAM 시스템과 비교해 본다면 이 방법은 어떤 성능을 보이는가?
- RQ5동적 물체가 장면을 지배하거나 카메라 운동이 최소일 경우 시스템의 실패 모드는 어떠한가?
주요 결과
- DytanVO는 KITTI 온도메트리 데이터셋에서 두 번째로 우수한 VO 방법보다 평균 27.7% 향상된 ATE 성능을 달성하였으며, KITTI에서의 미세조정 없이도 성능을 유지한다.
- AirDOS-Shibuya 데이터셋에서 DytanVO는 RoadCrossing VI 및 VII와 같이 매우 동적인 시퀀스에서도 추적을 유지하는 유일한 학습 기반 VO로, 모든 기준선 시스템이 실패하는 상황에서도 성능을 유지한다.
- 급격한 카메라 운동과 큰 동적 물체가 존재하는 시퀀스에서는 DytanVO가 AirDOS, VDO-SLAM, DynaSLAM과 같은 동적 SLAM 시스템보다 ATE 성능에서 80% 이상 향상되었다.
- 빠르게 움직이는 차량이나 큰 동적 물체가 존재하는 시퀀스, 예를 들어 KITTI의 시퀀스 10에서는 DytanVO가 유일하게 추적을 유지하며 안정적인 성능을 보였다.
- 백엔드 최적화를 사용하지 않음에도 불구하고 DROID-SLAM과 같은 백엔드 최적화 SLAM 시스템과 경쟁 가능한 성능을 보였다.
- 모든 전경 물체가 움직이고 배경이 무늬가 없을 경우 시스템은 실패한다. 이는 광학 흐름이 완전히 마스킹되기 때문에 추정이 발산하기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.