[논문 리뷰] Learning Depth from Monocular Videos Using Synthetic Data: A Temporally-Consistent Domain Adaptation Approach
이 논문은 실재 영상에서 단안 영상의 깊이 추정 성능을 햖을 수 있도록, 진짜 깊이, 광학 흐름, 카메라 자세가 모두 알려진 합성 영상을 활용하는 시간적으로 일관된 도메인 적응(TCDA) 프레임워크를 제안한다. 합성 데이터를 사용하여 이미지 번역, 깊이 예측, 움직임 마스크, 카메라 자세 네트워크를 동시에 학습하고 시간적 일관성을 강제함으로써, KITTI에서 최고 성능을 달성하고 Make3D로의 일반화 능력을 향상시켜 움직이는 물체와 도메인 간 차이로 인한 오차를 크게 줄였다.
Majority of state-of-the-art monocular depth estimation methods are supervised learning approaches. The success of such approaches heavily depends on the high-quality depth labels which are expensive to obtain. Some recent methods try to learn depth networks by leveraging unsupervised cues from monocular videos which are easier to acquire but less reliable. In this paper, we propose to resolve this dilemma by transferring knowledge from synthetic videos with easily obtainable ground-truth depth labels. Due to the stylish difference between synthetic and real images, we propose a temporally-consistent domain adaptation (TCDA) approach that simultaneously explores labels in the synthetic domain and temporal constraints in the videos to improve style transfer and depth prediction. Furthermore, we make use of the ground-truth optical flow and pose information in the synthetic data to learn moving mask and pose prediction networks. The learned moving masks can filter out moving regions that produces erroneous temporal constraints and the estimated poses provide better initializations for estimating temporal constraints. Experimental results demonstrate the effectiveness of our method and comparable performance against state-of-the-art.
연구 동기 및 목표
- 단안 영상 깊이 추정을 위한 실세계 깊이 주석을 수집하는 데 드는 높은 비용을 해결하기 위해.
- 움직이는 물체와 비정형 구조를 다루기 어려운 비지도 학습 방법의 한계를 극복하기 위해.
- 시간적 기하 제약 조건을 통합하여 합성 영상과 실세계 영상 간 도메인 적응을 향상시키기 위해.
- 합성 데이터를 깊이 감독 외에도 운동 마스크 학습과 카메라 자세 추정에 활용하여 실세계 일반화 능력을 향상시키기 위해.
- 이미지 번역 과정에서 도메인 간 차이와 구조적 왜곡을 줄이고 깊이 정확도를 유지하기 위해.
제안 방법
- GAN 기반의 이미지 번역 네트워크를 사용하여 합성 영상을 실세계 영상처럼 변환하는 도메인 적응 프레임워크.
- 깊이 예측, 움직임 마스크 예측, 상대 카메라 자세 추정을 위한 세 가지 작업 전용 헤드를 갖춘 공유 인코더-디코더 아키텍처.
- 움직임 마스크 예측 네트워크는 합성 데이터에서 제공하는 진짜 광학 흐름과 카메라 자세를 활용하여 동적 영역를 식별하고 마스킹한다.
- 영상 프레임 간 광학 일관성을 유지하기 위해 합성 영상과 실세계 영상 모두에 시간적 일관성 손실를 적용한다.
- 실세계 영상에서 시간 모델링을 위한 정확한 초기화를 제공하기 위해 카메라 자세 추정 네트워크를 합성 데이터와 함께 사전 훈련한다.
- 다중 작업 손실(제너레이터 대비 손실, 정체성 손실, 깊이 감독, 시간적 일관성)을 사용하여 이미지 번역, 깊이 예측, 시간적 일관성을 종합적으로 최적화하는 엔드 투 엔드 훈련.
실험 결과
연구 질문
- RQ1완전한 주석(깊이, 흐름, 자세)이 제공된 합성 영상이 실세계 영상의 단안 깊이 추정 성능 향상에 효과적으로 활용될 수 있는가?
- RQ2시간적 기하 일관성 조건을 통합할 경우 도메인 적응 품질과 깊이 예측 정확도가 어떻게 향상되는가?
- RQ3합성 데이터에서 유도한 움직이는 물체 탐지 기술이 실세계 영상에서 광학 일관성에 악영향을 주는 움직임의 영향을 줄일 수 있는가?
- RQ4합성 데이터에서 사전 훈련한 카메라 자세 네트워크가 실세계 단안 영상에서 시간 모델링 성능을 얼마나 향상시키는가?
- RQ5제안된 TCDA 프레임워크는 실세계 벤치마크에서 표준 도메인 적응 및 비지도 기반 기준 모델보다 어떻게 비교되는가?
주요 결과
- 제안된 TCDA 방법은 KITTI 벤치마크에서 기존 비지도 및 도메인 적응 방법을 능가하는 최고 성능을 달성했다.
- 절단 실험을 통해 시간적 일관성 손실(L_STC)과 도메인 적응(UDA) 모두 성능 향상에 기여하며, 둘을 조합할 경우 더 큰 성능 향상이 이루어짐을 확인했다.
- 움직임 마스크 예측 네트워크는 동적 물체로 인한 오차를 줄였으며, 움직이는 영역에서 광학 일관성 손실를 마스킹했을 때 성능 향상이 뚜렷하게 나타났다.
- 합성 데이터에서 사전 훈련한 카메라 자세 네트워크는 더 나은 초기화를 제공하여 실세계 영상에서 더 정확한 시간적 제약 조건을 확보했다.
- 메이크3D 데이터셋으로의 일반화 능력이 뛰어나 KITTI 외부 도메인에서도 강건함을 입증했다.
- 실패 케이스 분석을 통해 vKITTI 합성 데이터셋에 포함되지 않은 보행자 탐지에 한계가 있음을 확인하여, 더 다양한 합성 데이터가 필요함을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.