[논문 리뷰] RA-Depth: Resolution Adaptive Self-Supervised Monocular Depth Estimation
RA-Depth는 자기지도 학습 기반 단안 깊이 추정 방법을 제안하며, 임의의 스케일 데이터 증강과 이중 고해상도 네트워크, 교차 스케일 깊이 일관성 손실을 통해 해상도 적응 기능을 제공하면서도 최신 기술 수준의 성능을 달성한다. 이 방법은 다중 스케일 이미지에서 학습하면서 스케일 간 일관성을 강제하여 스케일 불변 깊이 예측을 학습함으로써 재학습 없이도 다양한 해상도 간 일반화 능력을 크게 향상시킨다.
Existing self-supervised monocular depth estimation methods can get rid of expensive annotations and achieve promising results. However, these methods suffer from severe performance degradation when directly adopting a model trained on a fixed resolution to evaluate at other different resolutions. In this paper, we propose a resolution adaptive self-supervised monocular depth estimation method (RA-Depth) by learning the scale invariance of the scene depth. Specifically, we propose a simple yet efficient data augmentation method to generate images with arbitrary scales for the same scene. Then, we develop a dual high-resolution network that uses the multi-path encoder and decoder with dense interactions to aggregate multi-scale features for accurate depth inference. Finally, to explicitly learn the scale invariance of the scene depth, we formulate a cross-scale depth consistency loss on depth predictions with different scales. Extensive experiments on the KITTI, Make3D and NYU-V2 datasets demonstrate that RA-Depth not only achieves state-of-the-art performance, but also exhibits a good ability of resolution adaptation.
연구 동기 및 목표
- 자기지도 학습 기반 단안 깊이 추정에서 테스트 해상도가 학습 해상도와 다를 경우 성능이 떨어지는 문제를 해결하기 위해.
- 재학습 없이도 단일 학습 모델이 여러 이미지 해상도 간 일반화할 수 있도록 하는 방법을 개발하기 위해.
- 데이터 증강과 새로운 손실 함수를 통해 스케일 불변성을 암묵적·명시적으로 학습하기 위해.
- 낮은 파rameter와 계산 오버헤드로 정확한 깊이 예측을 위한 다중 스케일 특징 융합을 가능하게 하는 효율적인 이중 HRNet 아키텍처를 설계하기 위해.
제안 방법
- 단일 입력에서 리사이징, 자르기, 붙이기를 통해 서로 다른 스케일을 가진 세 개의 이미지를 생성하는 임의의 스케일 데이터 증강(AS-Aug) 방법을 제안하며, 이미지 세부 정보를 유지하고 다양한 카메라 내재 매개변수를 시뮬레이션한다.
- 다중 경로 인코더와 디코더를 갖춘 이중 고해상도 네트워크(Dual HRNet)를 사용하여 다양한 스케일 간의 조밀한 특징 상호작용을 가능하게 하여 특징 집합을 향상시킨다.
- 동일한 장면의 서로 다른 스케일 입력에 대해 깊이 예측이 일관되도록 강제하는 교차 스케일 깊이 일관성 손실을 도입하여 명시적으로 스케일 불변성을 학습한다.
- 고해상도 표현을 네트워크 전반에 걸쳐 유지하기 위해 HRNet을 백본 인코더로 사용하여 특징 무결성과 깊이 정확도를 향상시킨다.
- 지오메트릭 지도를 스테레오 또는 단안 시퀀스로부터 사용하여 지도 없이 종단 간(end-to-end)으로 모델을 학습한다.
- 깊이 지도 손실과 제안된 교차 스케일 일관성 손실의 조합으로 최적화하여 다양한 해상도 간 일반화 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1재학습 없이 자기지도 학습 기반 단안 깊이 추정 모델이 다양한 입력 해상도 간 효과적으로 일반화할 수 있는가?
- RQ2데이터 증강을 어떻게 설계하여 모델이 장면 깊이의 스케일 불변성을 암묵적으로 학습시킬 수 있는가?
- RQ3다중 스케일 입력에서의 깊이 예측 간 일관성을 명시적으로 강제할 경우 어떤 영향을 미치는가?
- RQ4다중 스케일 특징 융합을 갖춘 이중 고해상도 네트워크는 깊이 추정 정확도와 효율성을 어떻게 향상시키는가?
- RQ5경량 모델이 낮은 파rameter 수와 FLOP 수를 유지하면서도 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- RA-Depth는 KITTI, Make3D, NYU-V2 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, KITTI에서 AbsRel 0.096, SqRel 0.632, RMSE 4.216의 성능을 기록하였다.
- 다른 해상도에서 테스트했을 때 기준 모델 대비 AbsRel 29.6%, SqRel 41.4%, RMSE 22.2%의 오차 감소를 기록하였다.
- 교차 스케일 깊이 일관성 손실은 해상도 적응 성능을 향상시켜 기준 모델 대비 정확도(δ<1.25)를 11.4% 향상시켰다.
- RA-Depth는 오직 9.98M 파arameter와 10.78 GFLOPs로 최신 기술 수준의 성능을 달성하였으며, 더 큰 파arameter 수를 가진 모델들을 능가하였다.
- 제안된 임의의 스케일 데이터 증강(AS-Aug)은 일반화 능력을 크게 향상시켰으며, 이미지 세부 정보를 유지하고 다중 스케일 학습을 가능하게 하여 이전 방법(Bian-Aug)을 능가하였다.
- 이중 HRNet 아키텍처는 효율적인 다중 스케일 특징 융합을 가능하게 하여 기존 최신 기술 수준의 모델들보다 낮은 계산 및 파arameter 비용으로 높은 정확도를 달성하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.