[논문 리뷰] CoVIO: Online Continual Learning for Visual-Inertial Odometry
CoVIO는 임베디드 장치에서 재난기반 시각-자이로스코픽 온라인 지속 학습을 위한 경량 단일 네트워크 아키텍처를 제안한다. 고정 크기의 다양성 최적화된 리플레이 버퍼를 사용해 치명적 기억 상실을 완화하며, 실시간 비동기 추론을 가능하게 하여 기존의 CL-SLAM과 비교해 도메인 적응에서 뛰어난 성능을 보이며, 낮은 메모리 사용량과 높은 정확도를 유지한다. 실제 데이터셋에서 검증된 결과이다.
Visual odometry is a fundamental task for many applications on mobile devices and robotic platforms. Since such applications are oftentimes not limited to predefined target domains and learning-based vision systems are known to generalize poorly to unseen environments, methods for continual adaptation during inference time are of significant interest. In this work, we introduce CoVIO for online continual learning of visual-inertial odometry. CoVIO effectively adapts to new domains while mitigating catastrophic forgetting by exploiting experience replay. In particular, we propose a novel sampling strategy to maximize image diversity in a fixed-size replay buffer that targets the limited storage capacity of embedded devices. We further provide an asynchronous version that decouples the odometry estimation from the network weight update step enabling continuous inference in real time. We extensively evaluate CoVIO on various real-world datasets demonstrating that it successfully adapts to new domains while outperforming previous methods. The code of our work is publicly available at http://continual-slam.cs.uni-freiburg.de.
연구 동기 및 목표
- 학습 데이터와 테스트 도메인이 다를 수 있는 오픈 월드 환경에서 학습 기반 시각-자이로스코픽 온로지그래피를 구현하는 데 도전한다.
- 임베디드 플랫폼에서 제한된 저장소를 가진 상태에서 경험 리플레이를 활용해 온라인 적응 중 치명적 기억 상실을 완화한다.
- 사람이 수동으로 도메인 경계를 감지하는 데 의존하지 않고, 지속적이고 자동적인 환경 적응을 가능하게 한다.
- 이중 네트워크 아키텍처인 CL-SLAM과 비교해 계산 및 메모리 오버헤드를 줄여 저전력 장치에서 실시간 배포를 가능하게 한다.
- 새로운 다양성 기반 리플레이 전략을 통해 지속적 적응 중 이동 및 회전 추정의 정확성과 강건성을 향상시킨다.
제안 방법
- CL-SLAM의 이중 네트워크 아키텍처를 포즈 및 깊이 추정에 공통으로 사용하는 단일 네트워크로 대체하여 학습을 단순화하고 GPU 메모리 사용량을 줄인다.
- 저장소 제약 조건 내에서 표현의 커버리지가 최대가 되도록 학습 가능한 다양성 지표를 사용해 가장 다양한 이미지만을 저장하는 고정 크기의 리플레이 버퍼를 구현한다.
- 기존 버퍼 샘플과의 기능 상이성이 높은 이미지를 우선순위로 선택하는 다양성 기반 샘플링 전략을 도입하여 일반화 능력을 향상시키고 중복을 줄인다.
- 비동기 업데이트 메커니즘을 통해 운동 추정을 네트워크 가중치 업데이트에서 분리하여, 지연 부담 없이 지속적인 추론을 가능하게 한다.
- 온라인 적응 중 포즈넷과 딥넷의 비지도 합동 학습을 수행하며, 자기지도 기반 깊이 감독과 포즈 일致성 손실을 활용한다.
- 들어오는 프레임마다 다중 업데이트 사이클을 적용해 가중치를 점진적으로 개선함으로써 전체 재학습이 필요 없이 수렴 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1고정 크기의 단일 경량 네트워크 아키텍처가 임베디드 장치에서 치명적 기억 상실을 효과적으로 완화하면서 지속적 시각-자이로스코픽 온로지그래피를 수행할 수 있는가?
- RQ2제한된 저장소 조건에서 고정 크기의 다양성 최적화 리플레이 버퍼가 무한 또는 무작위 리플레이 버퍼보다 일반화 능력과 정확도 측면에서 어떻게 비교되는가?
- RQ3비동기 온라인 학습이 지속적 적응 환경에서 정확도를 훼손하지 않고 실시간 추론을 얼마나 잘 지원할 수 있는가?
- RQ4리플레이 버퍼 크기, 배치 크기, 업데이트 사이클 수와 같은 하이퍼파라미터의 변화에 대해 성능가 얼마나 민감한가?
- RQ5제안된 방법이 다양한 실제 환경에서 기존의 지속 학습 베이스라인인 CL-SLAM보다 이동 및 회전 정확도 측면에서 뛰어나게 성능을 발휘할 수 있는가?
주요 결과
- CoVIO는 버퍼 크기가 100일 때 시퀀스 04에서 2.11m, 시퀀스 06에서 2.13m의 이동 오차를 기록하며, 동일 조건에서 CL-SLAM의 2.79m 및 1.98m를 초월한다.
- 버퍼 크기 100과 다양성 기반 샘플링을 적용했을 때 CoVIO는 비다양성 리플레이 전략 대비 시퀀스 04에서 23.6% 감소, 시퀀스 06에서 19.7% 감소한 이동 오차를 기록한다.
- 비동기 버전의 CoVIO는 진정한 실시간 추론을 가능하게 하며, 모델 업데이트에서 운동 추정을 분리해 동기식 방법에서 흔히 발생하는 지연 피크를 방지한다.
- CoVIO는 CL-SLAM보다 업데이트 사이클 수에 덜 민감하며, 단 한 번의 사이클만으로도 거의 최적의 성능을 달성하여 수렴 효율성이 향상됨을 보여준다.
- 배치 크기 3과 5개의 업데이트 사이클을 사용했을 때 CoVIO는 모든 평가 구성에서 가장 낮은 이동 및 회전 오차를 기록했으며, 표본 6의 볼드체로 가장 낮은 오차를 강조한다.
- 다양한 도메인 전반에서 뛰어난 성능 유지를 보이며, 명시적 도메인 분류나 인간 간섭 없이도 효과적인 지식 유지와 도메인 적응 능력을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.