Skip to main content
QUICK REVIEW

[논문 리뷰] Domain Adaptive Semantic Segmentation with Self-Supervised Depth Estimation

Qin Wang, Dengxin Dai|arXiv (Cornell University)|2021. 04. 28.
Domain Adaptation and Few-Shot Learning참고 문헌 58인용 수 6
한 줄 요약

이 논문은 영상의 색채, 조명, 시점의 차이로 인해 발생하는 도메인 간 차이를 보완하기 위해 자기지도 학습 기반 깊이 추정을 소스 및 타겟 도메인 양쪽에서 활용하여 도메인 간 이동을 보완하는 새로운 비지도 도메인 적응 프레임워크인 상관관계 인식 도메인 적응(CorDA)을 제안한다. 의미 특징과 깊이 특징 간의 작업 특징 상관관계를 명시적으로 모델링하고, 깊이 예측 불일치를 이용해 타겟 도메인의 가짜 레이블을 개선함으로써, CorDA는 SYNTHIA-to-Cityscapes에서 55.0% mIoU, GTA-to-Cityscapes에서 56.6% mIoU의 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Domain adaptation for semantic segmentation aims to improve the model performance in the presence of a distribution shift between source and target domain. Leveraging the supervision from auxiliary tasks~(such as depth estimation) has the potential to heal this shift because many visual tasks are closely related to each other. However, such a supervision is not always available. In this work, we leverage the guidance from self-supervised depth estimation, which is available on both domains, to bridge the domain gap. On the one hand, we propose to explicitly learn the task feature correlation to strengthen the target semantic predictions with the help of target depth estimation. On the other hand, we use the depth prediction discrepancy from source and target depth decoders to approximate the pixel-wise adaptation difficulty. The adaptation difficulty, inferred from depth, is then used to refine the target semantic segmentation pseudo-labels. The proposed method can be easily implemented into existing segmentation frameworks. We demonstrate the effectiveness of our approach on the benchmark tasks SYNTHIA-to-Cityscapes and GTA-to-Cityscapes, on which we achieve the new state-of-the-art performance of $55.0\%$ and $56.6\%$, respectively. Our code is available at \url{https://qin.ee/corda}.

연구 동기 및 목표

  • 소스 도메인과 타겟 도메인의 외관, 조명, 시점 차이로 인한 의미 분할의 도메인 간 이동 문제를 해결한다.
  • 기존 방법이 소스 도메인에서만 진짜 깊이 데이터에 의존하는 한계를 극복하기 위해, 두 도메인 모두에서 이용 가능한 자기지도 학습 기반 깊이 추정을 활용한다.
  • 다양한 도메인 간 의미 특징과 깊이 특징 간의 불변 상관관계를 활용하여 타겟 도메인의 분할 성능을 향상시킨다.
  • 도메인 특화 깊이 디코더 간의 깊이 예측 불일치를 기반으로 한 적응 난이도 추정을 통해 타겟의 의미 분할 가짜 레이블을 개선한다.
  • 기존의 UDA 분할 아키텍처와 호환되는 플러그 앤 플레이 프레임워크를 개발하여 실용적 구현을 가능하게 한다.

제안 방법

  • 소스 및 타겟 도메인의 스테레오 쌍 또는 비디오 시퀀스에서 자기지도 학습 기반 깊이 추정기를 훈련시켜 가짜 깊이 지도를 생성한다.
  • 의미 특징과 깊이 특징 간의 작업 특징 상관관계를 명시적으로 학습하고 도메인 간 전달을 가능하게 하기 위해 도메인 공유 다중 모odal 디스틸레이션 모듈을 도입한다.
  • 동일한 타겟 이미지에 대해 도메인 특화 깊이 디코더를 사용해 깊이를 예측하고, 이들의 예측 불일치를 적응 난이도의 근사치로 계산한다.
  • 추정된 적응 난이도를 활용해 자기학습 과정에서 타겟 의미 분할 가짜 레이블의 신뢰도를 재가중하거나 개선한다.
  • 적대적 훈련 요소 없이도 표준 자기학습 UDA 파이프라인에 상관관계 학습 및 가짜 레이블 개선 모듈을 통합한다.
  • 경량이고 미분 가능한 모듈을 사용하여 기존 분할 아키텍처와의 호환성을 확보하고, 인코더-디코더 아키텍처에 쉽게 통합할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1스테레오 또는 비디오 시퀀스에서의 자기지도 학습 기반 깊이 추정이 진짜 깊이 데이터가 없더라도 도메인 간 이동을 효과적으로 줄일 수 있는가?
  • RQ2의미 특징과 깊이 특징 간의 상관관계를 명시적으로 모델링하고 도메인 간 전달함으로써 분할 일반화 성능를 향상시킬 수 있는가?
  • RQ3두 개의 도메인 특화 디코더에서 유도된 깊이 예측 불일치가 타겟 도메인의 적응 난이도에 신뢰할 수 있는 대체 지표가 될 수 있는가?
  • RQ4깊이 기반 적응 난이도를 활용해 타겟 가짜 레이블을 개선하는 것이 기존 자기학습 기반 베이스라인 대비 분할 정확도 향상에 기여하는가?
  • RQ5제안된 방법이 SYNTHIA-to-Cityscapes 및 GTA-to-Cityscapes와 같은 다양한 도메인 적응 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • CorDA는 SYNTHIA-to-Cityscapes 벤치마크에서 기존 SOTA 방법인 DACS보다 6.7%p 높은 55.0% mIoU의 새로운 최신 기술 수준 성능을 달성한다.
  • GTA-to-Cityscapes 벤치마크에서는 56.6% mIoU를 기록하여 DACS 대비 4.5%p의 절대적 향상을 이룬다. 이는 다른 깊이 보강 방법들보다도 뚜렷한 성능 격차를 확보한다.
  • ImageNet 전학습 가중치만을 사용하는 경우에도 성능이 유지되어, SYNTHIA-to-Cityscapes에서 54.6% mIoU, GTA-to-Cityscapes에서 56.4% mIoU를 기록함으로써 전학습 선택에 대한 강건성을 입증한다.
  • 정성적 결과 분석을 통해 보행로 및 도로와 같이 모호한 클래스에서의 성능 향상이 뚜렷하게 나타나, 어려운 식별 영역으로의 일반화 능력 향상이 확인된다.
  • 제거 실험을 통해 명시적 상관관계 학습 및 깊이 기반 가짜 레이블 개선 요소가 성능 향상에 기여하는 바가 크다는 것이 확인되었다.
  • 단안 및 스테레오 깊이 추정 모두에 대해 호환되며, 깊이 추정 모odal의 유형에 관계없이 일관된 성능 향상이 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.