Skip to main content
QUICK REVIEW

[논문 리뷰] UVCGAN: UNet Vision Transformer cycle-consistent GAN for unpaired image-to-image translation

D. Torbunov, Yi Huang|arXiv (Cornell University)|2022. 03. 04.
Generative Adversarial Networks and Image Synthesis인용 수 11
한 줄 요약

UVCGAN은 생성기 아키텍처에 비전 트랜스포머(ViT)를 통합하고 기울기 페널티와 자기지도 학습 전훈을 결합함으로써 CycleGAN을 향상시킨 새로운 비쌍점 이미지 간 번역 모델을 제안한다. 이 방법은 사이클 일致성 조건을 엄격히 유지하면서도 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하여 더 복잡한 모델들보다 이미지 품질과 콘텐츠 충실도 면에서 뛰어나다.

ABSTRACT

Unpaired image-to-image translation has broad applications in art, design, and scientific simulations. One early breakthrough was CycleGAN that emphasizes one-to-one mappings between two unpaired image domains via generative-adversarial networks (GAN) coupled with the cycle-consistency constraint, while more recent works promote one-to-many mapping to boost diversity of the translated images. Motivated by scientific simulation and one-to-one needs, this work revisits the classic CycleGAN framework and boosts its performance to outperform more contemporary models without relaxing the cycle-consistency constraint. To achieve this, we equip the generator with a Vision Transformer (ViT) and employ necessary training and regularization techniques. Compared to previous best-performing models, our model performs better and retains a strong correlation between the original and translated image. An accompanying ablation study shows that both the gradient penalty and self-supervised pre-training are crucial to the improvement. To promote reproducibility and open science, the source code, hyperparameter configurations, and pre-trained model are available at https://github.com/LS4GAN/uvcgan.

연구 동기 및 목표

  • 비쌍점 이미지 간 번역을 통해 시뮬레이션된 데이터와 실제 실험 데이터 간의 격차를 해소하여 과학적 시뮬레이션의 격차를 메운다.
  • 사이클 일치성 조건을 완화하지 않고도 성능을 향상시킬 수 있도록 고전적인 CycleGAN 프레임워크를 개선한다. 이는 과학적 타당성에 매우 중요하다.
  • U-Net 기반 백본을 비전 트랜스포머로 교체하여 이미지 번역에서 장거리 공간적 의존성 모델링을 향상시킨다.
  • 기울기 페널티와 자기지도 학습 전훈과 같은 고급 기법을 통해 훈련 안정성과 일반화 능력을 향상시킨다.
  • 오픈소스 레포지터리에서 코드, 하이퍼파라미터, 사전 학습 모델을 공개하여 재현 가능성을 증진시킨다.

제안 방법

  • 장거리 의존성을 더 효과적으로 모델링하기 위해 CycleGAN의 U-Net 생성기 대신 비전 트랜스포머(ViT) 인코더-디코더 아키텍처를 도입한다.
  • 원본 이미지와 번역된 이미지 간 일对일 매핑을 강제하기 위해 사이클 일치 손실을 통합하여 의미적 콘텐츠를 유지한다.
  • 제안된 GAN 최적화의 안정성을 확보하고 모드 붕괴를 방지하기 위해 적응형 학습 중 기울기 페널티(GP)를 적용한다.
  • ViT 인코더의 초기화를 위해 ImageNet 또는 유사 데이터셋에서 자기지도 학습을 수행하여 특징 학습 능력과 수렴 성능를 향상시킨다.
  • 사이클 일치 손실과 인지적 손실을 함께 사용하여 두 개의 적대적 생성기(A→B 및 B→A)를 종합적으로 훈련한다.
  • ViT의 멀티헤드 자기주의 메커니즘을 활용하여 모델이 눈과 입과 같은 의미적으로 관련 있는 이미지 영역에 집중할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머 기반 생성기가 사이클 일치 조건을 엄격히 유지하면서도 비쌍점 이미지 간 번역의 품질을 향상시킬 수 있는가?
  • RQ2기울기 페널티와 자기지도 학습 전훈은 표준 CycleGAN 대비 UVCGAN의 성능 향상에 어떻게 기여하는가?
  • RQ3ViT를 CycleGAN 프레임워크에 통합함으로써 번역된 이미지의 콘텐츠와 정체성 보존 능력이 향상되는가?
  • RQ4UVCGAN은 사이클 일치 조건을 완화하지 않고도 더 복잡한 현대 모델들을 능가할 수 있는가?
  • RQ5ViT의 주의 맵이 입력 이미지에서 의미 있는, 인간의 주의 패턴과 일치하는 영역을 얼마나 잘 강조하는가? 이는 해석 가능성과 관련성의 지표가 된다.

주요 결과

  • UVCGAN은 Horse→Zebra, Apple→Orange 등 여러 벤치마크에서 이전 최신 기술 수준의 모델들을 능가하여 더 낮은 FID 및 LPIPS 점수를 기록했다.
  • Horse→Zebra 데이터셋에서 UVCGAN은 FID 11.0과 LPIPS 0.85±0.09를 달성하여 SPA-GAN 및 AdaIN-SPADE와 같은 모델들을 능가했다.
  • 제거 실험 결과, 기울기 페널티와 자기지도 학습 전훈 모두 필수적임을 확인했으며, 둘 중 하나를 제거하면 성능이 크게 떨어졌다.
  • 주의 맵 시각화 결과, 모델이 눈과 입과 같은 핵심 얼굴 영역에 집중하고 있으며, 인간의 시각 주의 패턴과 일치함을 확인하여 의미 있는 특징 학습이 이루어졌음을 시사했다.
  • UVCGAN은 ImageNet 기반 번역 작업에서 FID 1.77±0.21과 LPIPS 1.77±0.21을 기록하여 강력한 일반화 능력을 입증했다.
  • 원래 CycleGAN보다 훈련 비용이 높지만, 더 복잡한 디퓨전 또는 노멀라이징 플로우 모델들에 비해 환경 영향은 크게 낮아서 지속 가능성이 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.