Skip to main content
QUICK REVIEW

[논문 리뷰] Semantically Adaptive Image-to-image Translation for Domain Adaptation of Semantic Segmentation

Luigi Musto, Andrea Zinelli|arXiv (Cornell University)|2020. 09. 02.
Domain Adaptation and Few-Shot Learning인용 수 13
한 줄 요약

이 논문은 영상 분할에서 도메인 적응을 위한 의미적 적응형 이미지 간 번역 프레임워크를 제안한다. 생성자는 예측된 의미 맵에 조건화되어 이질적 도메인 간 일관성을 향상시킨다. 대칭 교차 엔트로피 손실과 SPADE 기반 정규화를 통합함으로써, DeepLabV2와 FCN8s를 사용하여 GTA5→Cityscapes에서 +3.7%의 mIoU 향상을, SYNTHIA→Cityscapes에서 +2.5%의 mIoU 향상을 달성한다.

ABSTRACT

Domain shift is a very challenging problem for semantic segmentation. Any model can be easily trained on synthetic data, where images and labels are artificially generated, but it will perform poorly when deployed on real environments. In this paper, we address the problem of domain adaptation for semantic segmentation of street scenes. Many state-of-the-art approaches focus on translating the source image while imposing that the result should be semantically consistent with the input. However, we advocate that the image semantics can also be exploited to guide the translation algorithm. To this end, we rethink the generative model to enforce this assumption and strengthen the connection between pixel-level and feature-level domain alignment. We conduct extensive experiments by training common semantic segmentation models with our method and show that the results we obtain on the synthetic-to-real benchmarks surpass the state-of-the-art.

연구 동기 및 목표

  • 합성 데이터로 훈련된 모델을 실세계 시나리오에 적응시켜 영상 분할에서의 도메인 이동 문제를 해결한다.
  • 기존의 이미지 간 번역 방법은 영상 분할 작업의 의미를 고려하지 않아 발생하는 한계를 해결한다.
  • 이미지 번역과 분할 예측을 동시에 최적화하여 소스 도메인과 타겟 도메인 간 정렬을 강화한다.
  • GTA5와 SYNTHIA의 합성 데이터를 활용하여 실세계 벤치마크인 Cityscapes에서 일반화 능력과 성능을 향상시킨다.
  • 분할 및 번역 네트워크가 상호 조건화되어 특징 수준과 픽셀 수준의 도메인 정렬을 향상시키는 통합 프레임워크를 개발한다.

제안 방법

  • 소스 이미지 $X_S$ 로부터 의미 맵을 생성하는 분할 네트워크 $M$ 을 사용하며, 이는 이미지 번역 생성자 $F_{S\rightarrow T}$ 를 지시한다.
  • 의미 맵에 기반한 인스턴스별 정규화를 적용하기 위해 SPADE (공간적 적응형 배치 정규화) 레이어를 생성자에 조건화한다.
  • 원본 소스 이미지와 번역된 이미지의 예측 간 대칭 교차 엔트로피 손실 $\mathcal{L}_{SCE}$ 를 통해 이질적 도메인 간 의미 일관성을 강제한다.
  • 소스 이미지와 번역된 이미지 양쪽에 공통된 분할 헤드를 공유하여 분할 네트워크를 엔드 투 엔드로 훈련시킨다.
  • 번역된 이미지의 현실성과 의미 정확성을 향상시키기 위해 분할 판별자 $D_{\text{seg}}$ 와 함께 adversarial 훈련을 통합한다.
  • 특징 수준의 정렬을 위해 adversarial 손실을 적용하고 픽셀 수준의 일관성을 위해 $\mathcal{L}_{SCE}$ 를 사용하여, 예측된 클래스 분포가 도메인 간에 안정적으로 유지되도록 보장한다.

실험 결과

연구 질문

  • RQ1의미 유도가 의미 분할을 위한 비지도 도메인 적응에서 이미지 간 번역의 품질과 도메인 정렬에 기여하는가?
  • RQ2번역 생성자를 예측된 의미 맵에 조건화하는 것이 후속 분할 모델의 성능에 어떤 영향을 미치는가?
  • RQ3원본 이미지와 번역된 이미지 간 대칭 교차 엔트로피 손실을 강제로 적용할 경우 도메인 일반화 능력이 얼마나 향상되는가?
  • RQ4SPADE 기반 정규화와 임무 인지 일관성 손실을 조합하면 기존의 최상위 성능(SOTA) 방법보다 더 높은 mIoU를 달성하는가?
  • RQ5초기 시각적 도메인 갭(예: GTA5와 Cityscapes 간 vs. SYNTHIA와 Cityscapes 간)이 번역 품질과 분할 성능에 어떤 영향을 미치는가?

주요 결과

  • DeepLabV2를 사용한 GTA5→Cityscapes 벤치마크에서 제안된 방법은 mIoU 50.4를 달성하여 이전 최상위 성능(SOTA)보다 +3.7% 향상되었다.
  • FCN8s를 사용한 SYNTHIA→Cityscapes 벤치마크에서 제안된 방법은 이전 최상위 성능(SOTA)보다 mIoU를 +2.5% 향상시켰다.
  • 제거 실험 결과, SPADE 또는 $\mathcal{L}_{SCE}$ 를 제거할 경우 mIoU가 감소하여 두 구성 요소가 최적 성능을 위해 필수적임을 확인하였다.
  • 번역된 GTA5 이미지의 Fréchet Inception Distance (FID) 는 27.9로, SYNTHIA의 100.8보다 현저히 낮아 Cityscapes와의 시각적 일치도가 높음을 시사한다.
  • Inception Score (IS ≈ 4.9–5.0) 는 낮지만 FID 결과는 의미 유도가 시각적 현실성과 도메인 전이 품질을 향상시킨다는 것을 확인한다.
  • GTA5→Cityscapes에서 실존 레이블로 훈련된 오라클 모델에 비해 상한선까지의 갭을 14.7% 감소시켜 강력한 도메인 적응 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.