Skip to main content
QUICK REVIEW

[논문 리뷰] DA-GAN: Instance-level Image Translation by Deep Attention Generative Adversarial Networks (with Supplementary Materials)

Shuang Ma, Jianlong Fu|arXiv (Cornell University)|2018. 02. 18.
Generative Adversarial Networks and Image Synthesis참고 문헌 34인용 수 11
한 줄 요약

DA-GAN은 쌍이 없는 이미지 도메인 간의 인스턴스 수준 대응 관계를 학습하기 위해 심층 주의 생성자 적대망을 활용하는 새로운 비지도 이미지 번역 프레임워크를 제안한다. 주의 메커니즘을 GAN 아키텍처에 통합하고 일致성, 대칭성, 다중 적대적 항목을 포함한 복합 손실 함수를 적용함으로써, DA-GAN은 자세 모핑, 객체 구성, 데이터 증강 등의 작업에서 우수한 성능을 달성하며, 모드 붕괴를 크게 줄이고 고해상도이자 의미적으로 정렬된 이미지를 생성한다.

ABSTRACT

Unsupervised image translation, which aims in translating two independent sets of images, is challenging in discovering the correct correspondences without paired data. Existing works build upon Generative Adversarial Network (GAN) such that the distribution of the translated images are indistinguishable from the distribution of the target set. However, such set-level constraints cannot learn the instance-level correspondences (e.g. aligned semantic parts in object configuration task). This limitation often results in false positives (e.g. geometric or semantic artifacts), and further leads to mode collapse problem. To address the above issues, we propose a novel framework for instance-level image translation by Deep Attention GAN (DA-GAN). Such a design enables DA-GAN to decompose the task of translating samples from two sets into translating instances in a highly-structured latent space. Specifically, we jointly learn a deep attention encoder, and the instancelevel correspondences could be consequently discovered through attending on the learned instance pairs. Therefore, the constraints could be exploited on both set-level and instance-level. Comparisons against several state-ofthe- arts demonstrate the superiority of our approach, and the broad application capability, e.g, pose morphing, data augmentation, etc., pushes the margin of domain translation problem.

연구 동기 및 목표

  • 기존의 비지도 이미지 번역 방법이 오직 집합 수준의 분포 매칭에 의존함으로써 발생하는 한계를 해결하기 위해.
  • 쌍이 없는 훈련 데이터를 사용하여 의미 있는 인스턴스 수준 대응 관계(예: 의미적 부분, 객체 기하학)를 발견하기 위해.
  • 새로운 복합 손실 함수를 통해 인스턴스 수준과 집합 수준의 제약 조건을 동시에 향상시키기 위해.
  • 자세 모핑, 객체 변형, 데이터 증강과 같은 작업에서 시각적 정밀도와 의미적 일致성을 향상시키기 위해.

제안 방법

  • 생성자에 주의 메커니즘을 통합하여 잠재 공간 내 의미 있는 의미적 부분에 주의를 기울임으로써 인스턴스 수준의 대응 관계를 학습한다.
  • 일치성 손실(잠재 공간 내 의미적 정렬 보장), 대칭성 손실(일对일 매핑 강제), 다중 적대적 손실(모드 붕괴 방지)을 조합한 복합 손실 함수를 제안한다.
  • 소스 및 타겟 이미지를 구조화된 잠재 공간으로 투영하기 위해 심층 주의 인코더(DAE)를 사용한다.
  • 다중 적대적 훈련을 통해 타겟 도메인의 모든 모드에 대해 확률 질량을 공정하게 분배함으로써 모드 붕괴를 완화한다.
  • 특징 추출을 위해 VGG19 네트워크를 미세 조정하고, Inception Score와 누락된 모드 수를 평가 지표로 사용한다.
  • 텍스트-이미지 번역, 자세 모핑, 객체 구성, 데이터 증강 등 다양한 작업에 프레임워크를 적용한다.

실험 결과

연구 질문

  • RQ1비지도 이미지 번역이 쌍이 없는 데이터 없이도 의미 있는 인스턴스 수준의 대응 관계를 학습할 수 있는가?
  • RQ2주의 메커니즘이 GAN에 효과적으로 통합되어 이미지 번역에서 의미적 정렬을 향상시킬 수 있는가?
  • RQ3일치성, 대칭성, 다중 적대적 항목을 포함한 복합 손실 함수가 모드 붕괴를 줄이고 번역 품질을 향상시킬 수 있는가?
  • RQ4기하학적 및 의미적 정밀도가 요구되는 작업에서 DA-GAN은 최신 기술 대비 어느 정도 뛰어난 성능을 보이는가?
  • RQ5DA-GAN은 자세 모핑 및 데이터 증강과 같은 다양한 응용 분야로 일반화될 수 있는가?

주요 결과

  • DA-GAN은 VAT(10.3)와 CycleGAN(11.4)에 비해 훨씬 높은 Inception Score(20.9)를 달성하여 이미지 품질과 다양성이 뛰어나다는 것을 시사한다.
  • DA-GAN을 사용할 경우 누락된 모드 수가 크게 감소하여 타겟 도메인의 모드를 효과적으로 커버하고 있음을 보여준다.
  • 객체 구성 작업에서 DA-GAN은 CUB-200-2011 데이터셋에서 Top-1 정확도 88.9%를 기록하여 VAT(42.1%)와 CycleGAN(62.1%)를 압도적으로 앞선다.
  • CycleGAN과 VAT에 비해 DA-GAN이 생성한 이미지는 특히 기하학적 구조와 세밀한 속성 전달에서 더 선명한 세부 사항과 더 적은 아티팩트를 보인다.
  • 10,000장의 DA-GAN 생성된 새 이미지를 활용한 데이터 증강으로 세분화된 분류 정확도가 79.0%에서 81.6%로 향상되었다.
  • DA-GAN은 인간 얼굴을 애니메이션 스타일로 성공적으로 번역하면서도 정체성을 유지했고, VAT는 도메인 불일치 및 아티팩트가 많은 결과를 생성하는 데에 실패했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.