[논문 리뷰] Label-Driven Reconstruction for Domain Adaptation in Semantic Segmentation
이 논문은 정합성 분할에서 도메인 적응을 위한 레이블 기반 재구성 프레임워크를 제안하며, 예측된 레이블에서 직접 이미지를 재구성함으로써 이미지 번역 편향을 줄인다. 이 방법은 최신 기술 수준의 성능을 달성하여, GTA5에서 Cityscapes로의 전이에서 기준 방법 대비 mIoU를 1.3% 향상시키며, ResNet101 및 VGG16 백본 모두에서 기존 최신 기술을 능가한다.
Unsupervised domain adaptation enables to alleviate the need for pixel-wise annotation in the semantic segmentation. One of the most common strategies is to translate images from the source domain to the target domain and then align their marginal distributions in the feature space using adversarial learning. However, source-to-target translation enlarges the bias in translated images and introduces extra computations, owing to the dominant data size of the source domain. Furthermore, consistency of the joint distribution in source and target domains cannot be guaranteed through global feature alignment. Here, we present an innovative framework, designed to mitigate the image translation bias and align cross-domain features with the same category. This is achieved by 1) performing the target-to-source translation and 2) reconstructing both source and target images from their predicted labels. Extensive experiments on adapting from synthetic to real urban scene understanding demonstrate that our framework competes favorably against existing state-of-the-art methods.
연구 동기 및 목표
- 합성된 도메인에서 실세계 도메인으로의 전이 시 도메인 이동 문제를 해결하기 위해.
- 소스에서 타겟으로의 번역 방법에서 내재된 이미지 번역 편향과 계산 비용을 줄이기 위해.
- 예측된 레이블에서 이미지를 재구성함으로써 동일한 의미 카테고리 간의 교차 도메인 특징 정렬을 강제하기 위해.
- 공동 분포 정렬을 통해 도메인 간 예측의 일반화와 일관성을 향상시키기 위해.
- GTA5에서 Cityscapes, SYNTHIA에서 Cityscapes와 같은 표준 벤치마크에서 기존 도메인 적응 방법을 능가하기 위해.
제안 방법
- 타겟 이미지를 소스 도메인 이미지와 유사하게 만들기 위해 타겟에서 소스로의 이미지 번역을 수행함으로써 번역 편향을 줄이고, 소스에서 타겟으로의 번역보다 계산 비용을 낮춘다.
- 특징 표현이 아닌 예측된 의미 레이블에서 직접 이미지를 생성하는 재구성 네트워크를 도입한다.
- 재구성된 이미지와 원본 이미지 간의 의미적 이탈을 방지하기 위해 레이블 공간 재구성 손실을 사용하여 전반적인 의미 일관성을 강제한다.
- 모서리 분포와 공동 분포를 모두 정렬하기 위해 적대적 특징 정렬과 재구성 손실을 결합한다.
- 기울기 전파가 가능한 학습을 위해 이산 레이블 맵을 근사하기 위해 온도 조절 소프트 레이블 매핑을 사용한다.
- 재구성된 이미지의 고수준 의미 및 질감 유지성을 위해 VGG 퍼셉추얼 손실과 디세크리미네이터 특징 매칭 손실을 활용한다.
실험 결과
연구 질문
- RQ1타겟에서 소스로의 번역이 소스에서 타겟으로의 번역보다 도메인 적응에서 번역 편향을 줄이고 효율성을 높일 수 있는가?
- RQ2레이블 공간에서 예측된 레이블에서 직접 이미지를 재구성하는 것이 특징 공간 재구성보다 교차 도메인 특징 정렬을 더 잘 이룰 수 있는가?
- RQ3레이블 기반 이미지 재구성은 공동 분포 정렬을 향상시키고 의미 분할에서 오분류를 줄일 수 있는가?
- RQ4제안된 방법은 합성에서 실세계 도시 환경로의 최신 기술 기반 벤치마크에서 기존 최신 기술 기법보다 어떻게 비교되는가?
- RQ5최고의 성능을 내기 위해 소프트 레이블 매핑의 온도와 같은 하이퍼파라미터의 최적 설정은 무엇인가?
주요 결과
- ResNet101 기반으로 GTA5에서 Cityscapes로의 전이에서 49.5 mIoU를 달성하여, 소스 전용 기준 방법 대비 12.9% 향상되었다.
- VGG16 기반으로는 43.6 mIoU를 기록하여, 소스 전용 기준 방법 대비 25.7% 향상되었고, CyCADA와 BDL 대비 각각 8.2%와 2.3% 높았다.
- 타겟에서 소스로의 번역만으로도 ResNet101 기준 mIoU가 0.6% 향상되었고, VGG16 기준으로는 1.0% 향상되었다.
- 레이블 공간 재구성 기능을 추가함으로써 ResNet101 기준 1.3% mIoU 향상, VGG16 기준 1.1% 향상되어 그 효과를 입증하였다.
- GTA5에서 Cityscapes 전이에서 레이블 공간 재구성은 특징 공간 재구성 대비 2.12% 높은 성능(43.6 vs. 41.48 mIoU)을 기록하였고, SYNTHIA에서 Cityscapes 전이에서는 0.97% 높은 성능(41.1 vs. 40.13 mIoU)을 기록하였다.
- 최적의 온도 하이퍼파라미터 τ는 0.001로 확인되었으며, 이는 모든 실험에서 최고의 mIoU 성능을 내는 데 기여하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.