Skip to main content
QUICK REVIEW

[논문 리뷰] DESC: Domain Adaptation for Depth Estimation via Semantic Consistency

Adrian Lopez-Rodriguez, Krystian Mikolajczyk|arXiv (Cornell University)|2020. 09. 03.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 단안 영상 깊이 추정을 위한 도메인 적응 방법인 DESC를 제안한다. 이 방법은 타겟 도메인에 대한 레이블이 없는 상황에서 의미 일致성과 인스턴스 수준의 크기 사전 지식을 활용해 가짜 레이블을 생성한다. 깊이 모델과 의미 및 에지 특징을 기반으로 학습된 보조 모델 간의 일관성을 강제함으로써, Virtual KITTI에서 KITTI, Cityscapes에서 KITTI로의 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 절대 상대 오차를 최대 9.8% 감소시킨다.

ABSTRACT

Accurate real depth annotations are difficult to acquire, needing the use of special devices such as a LiDAR sensor. Self-supervised methods try to overcome this problem by processing video or stereo sequences, which may not always be available. Instead, in this paper, we propose a domain adaptation approach to train a monocular depth estimation model using a fully-annotated source dataset and a non-annotated target dataset. We bridge the domain gap by leveraging semantic predictions and low-level edge features to provide guidance for the target domain. We enforce consistency between the main model and a second model trained with semantic segmentation and edge maps, and introduce priors in the form of instance heights. Our approach is evaluated on standard domain adaptation benchmarks for monocular depth estimation and show consistent improvement upon the state-of-the-art.

연구 동기 및 목표

  • 정확한 깊이 레이블을 확보하는 데 어려움이 있으며, 이는 LiDAR와 같은 전용 센서가 필요하기 때문이다.
  • 원천 도메인에서의 의미 레이블을 활용해 타겟 도메인의 깊이 레이블이 없는 환경에서 단안 영상 깊이 추정을 향상시키기 위해 노력한다.
  • 합성(원천) 도메인과 실제(타겟) 도메인 간의 도메인 갭을 의미 일관성과 인스턴스 기반 깊이 사전 지식을 통해 메우고자 한다.
  • 타겟 도메인에서 스테레오 또는 비디오 감독을 요구하지 않고도 깊이 추정 성능을 향상시키고자 한다.

제안 방법

  • 타겟 도메인에서 의미 및 에지 특징을 유도하기 위해 사전에 훈련된 패노픽 세그멘테이션 모델을 활용한다.
  • 원천 도메인에서 학습된 인스턴스 수준의 크기 사전 지식을 활용해 타겟 도메인에서 깊이 가짜 레이블을 생성한다.
  • 주 깊이 추정 네트워크와 의미 및 에지 맵에서 깊이를 예측하는 보조 네트워크 간의 일관성 손실을 도입한다.
  • 일관성 손실을 적응적으로 스케일링하기 위해 학습 가능한 스칼라를 활용하여 도메인 이동에 대한 일반화 성능을 향상시킨다.
  • 자기 지도적 깊이 손실과 의미 일관성 손실의 조합을 사용해 주 모델을 훈련시킨다.
  • 보조 네트워크가 의미 및 에지 입력에서 학습되어 주 모델과의 구조적 일관성을 강제하는 이중 브랜치 아키텍처를 활용한다.

실험 결과

연구 질문

  • RQ1원천 도메인과 타겟 도메인 간의 의미 일관성이, 타겟 깊이 레이블이 없는 도메인 적응 설정에서 깊이 추정 성능을 향상시키는 데 효과적인가?
  • RQ2인스턴스 수준의 크기 사전 지식을 가짜 레이블로 사용할 경우, 타겟 도메인의 깊이 추정 성능 향상에 얼마나 효과적인가?
  • RQ3의미 및 에지 특징을 기반으로 학습된 모델과 깊이 모델 간의 일관성 강제가 도메인 이동에 대한 일반화 성능 향상에 기여하는가?
  • RQ4제안된 방법이 기존의 단안 영상 깊이 추정 도메인 적응 기법보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ5이 방법은 추가 감독 없이도 Virtual KITTI에서 KITTI, Cityscapes에서 KITTI와 같은 다양한 데이터셋 간에 일반화 가능한가?

주요 결과

  • Virtual KITTI에서 KITTI로의 벤치마크에서 DESC는 최신 기술 수준(SOTA) 대비 절대 상대 오차(Sq Rel)를 9.8% 낮춘다.
  • Cityscapes에서 KITTI로의 벤치마크에서 DESC는 T 2 Net 대비 절대 상대 오차를 13.9% 감소시켜 강력한 도메인 일반화 성능을 입증한다.
  • 의미 유도 네트워크와의 일관성 항목이 성능 향상에 기여하는 것으로 애버레이션 연구를 통해 입증되었다.
  • 세 프레임 리파인먼트를 사용하는 Struct2Depth(M+R)보다 DESC가 성능이 뛰어나지만, 추론에 단일 이미지만 필요로 한다.
  • ImageNet 사전 훈련 없이도 최신 기술 수준 성능을 달성했으며, 동일한 설정에서 Monodepth2를 능가한다.
  • 정성적 결과 분석을 통해 T 2 Net 및 GASDA 대비 차량 및 기둥과 같은 물체의 기하학적 완전성이 향상된 예측 깊이 맵을 제공함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.