Skip to main content
QUICK REVIEW

[논문 리뷰] Semantics-Aware Image to Image Translation and Domain Transfer

Pravakar Roy, Nicolai Häni|arXiv (Cornell University)|2019. 04. 03.
Generative Adversarial Networks and Image Synthesis참고 문헌 46인용 수 8
한 줄 요약

이 논문은 공유 인코더-디코더 아키텍처를 사용하여 도메인 간 이미지와 그들의 의미적 레이블을 함께 번역하는 의미 인식 이미지 간 번역 프레임워크인 SemGAN을 제안한다. 교차 도메인 일관성 및 개체 전형화 손실을 통해 의미적 구조를 유지하면서 SemGAN은 비지도 도메인 적응에서 최신 기술 수준의 성능을 달성하여 GTA5에서 Cityscapes로의 번역에서 평균 IoU 기준 5.4% 향상되고 픽셀 정확도 기준 13.5% 향상된다.

ABSTRACT

Image to image translation is the problem of transferring an image from a source domain to a different (but related) target domain. We present a new unsupervised image to image translation technique that leverages the underlying semantic information for object transfiguration and domain transfer tasks. Specifically, we present a generative adversarial learning approach that jointly translates images and labels from a source domain to a target domain. Our main technical contribution is an encoder-decoder based network architecture that jointly encodes the image and its underlying semantics and translates both individually to the target domain. Additionally, we propose object transfiguration and cross-domain semantic consistency losses that preserve semantic labels. Through extensive experimental evaluation, we demonstrate the effectiveness of our approach as compared to the state-of-the-art methods on unsupervised image-to-image translation, domain adaptation, and object transfiguration.

연구 동기 및 목표

  • 의미 분할 작업에서 합성 이미지와 실세계 이미지 간의 도메인 갭을 해결하기 위해.
  • 기하학적 및 스타일 변형이 있는 상황에서도 비지도 이미지 간 번역 중 의미 일관성을 유지하기 위해.
  • 이미지와 해당 의미적 레이블을 함께 번역하여 도메인 적응 성능을 향상시키기 위해.
  • 기존 GAN 기반 방법이 번역 중 레이블 일관성을 유지하지 못하는 한계를 극복하기 위해.
  • 도메인 간 의미 일관성을 강제하여 효과적인 개체 전형화를 가능하게 하기 위해.

제안 방법

  • 공유 인코더 네트워크가 입력 이미지와 의미 레이블 맵을 함께 공유 잠재 표현으로 인코딩한다.
  • 두 개의 별도 디코더 네트워크가 공유 잠재 코드에서 번역된 이미지와 해당 의미 레이블 맵을 재구성한다.
  • 모델은 재구성 정밀도와 도메인 전이 가능성 확보를 위해 사이클 일관성 손실로 훈련된다.
  • 교차 도메인 의미 일관성 손실은 번역된 이미지와 예측된 레이블 간의 의미적 정렬을 보장한다.
  • 개체 전형화 손실은 도메인 전이 중 개별 객체에 대한 구조 일관성을 강제한다.
  • 전반적인 목표는 적대적 손실, 재구성 손실, 도메인 일관성 손실, 전형화 손실을 결합하여 공동 최적화를 수행한다.

실험 결과

연구 질문

  • RQ1이미지와 의미 레이블의 공동 번역이 의미 분할에서 도메인 적응 성능을 향상시키는가?
  • RQ2제안된 교차 도메인 의미 일관성 손실이 번역 중 개체 수준의 의미를 유지하는 데 얼마나 효과적인가?
  • RQ3개체 전형화 손실을 포함함으로써 미리 보지 않은 도메인 이동에 대한 일반화 성능이 향상되는가?
  • RQ4분류 정확도와 IoU 측면에서 SemGAN은 최신 기술 수준의 비지도 이미지 간 번역 방법보다 어떻게 비교되는가?
  • RQ5합성에서 실세계 도로 풍경으로의 번역에서 모델이 의미 정밀도를 어느 정도 유지하는가?

주요 결과

  • SemGAN은 GTA5에서 Cityscapes로의 도메인 적응 벤치마크에서 평균 IoU 77.39%를 달성하여 이어지는 최고 성능 방법보다 5.4% 포인트 높게 기록했다.
  • 모델은 다음으로 좋은 방법보다 픽셀 정확도를 13.5% 포인트 향상시켜 21.71%에 도달했으며, 런업 메서드는 8.21%였다.
  • 교차 도메인 의미 일관성 손실(L_dom)을 제거하면 평균 IoU가 8% 포인트 감소하여 그 중요성이 입증되었다.
  • 제거 실험 결과, 교차 도메인 일관성 손실만으로도 평균 IoU가 8% 향상되고 픽셀 정확도가 23% 향상됨을 확인했다.
  • 정성적 결과에서는 SemGAN이 생성한 이미지가 CycleGAN, UNIT, SG-GAN보다 객체의 형태와 의미 구조를 더 잘 유지하고 있음을 보여주었다.
  • 모델은 실세계 간 번역에도 잘 일반화되어 있으며, 쌍화된 데이터 없이도 강력한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.