Skip to main content
QUICK REVIEW

[논문 리뷰] TcGAN: Semantic-Aware and Structure-Preserved GANs with Individual Vision Transformer for Fast Arbitrary One-Shot Image Generation

Yunliang Jiang, Lili Yan|arXiv (Cornell University)|2023. 02. 16.
Image Processing Techniques and Applications인용 수 4
한 줄 요약

TcGAN은 장거리 상관관계를 모델링하기 위해 개인화된 비전 트랜스포머(ViT)를 통합함으로써, CNN의 수신 영역 제한을 극복하고 빠른 임의의 일회성 이미지 생성을 위한 의미 인식 및 구조 유지 GAN을 제안한다. TcGAN은 SIFID가 0.0117, LPIPS가 0.0560, SSIM가 0.8449에 이르는 최신 기술 수준의 성능을 달성하며, 약 10분 만에 학습이 가능하여 ConSinGAN보다 1.6배 빠르고 SinGAN보다 6.5배 빠르다.

ABSTRACT

One-shot image generation (OSG) with generative adversarial networks that learn from the internal patches of a given image has attracted world wide attention. In recent studies, scholars have primarily focused on extracting features of images from probabilistically distributed inputs with pure convolutional neural networks (CNNs). However, it is quite difficult for CNNs with limited receptive domain to extract and maintain the global structural information. Therefore, in this paper, we propose a novel structure-preserved method TcGAN with individual vision transformer to overcome the shortcomings of the existing one-shot image generation methods. Specifically, TcGAN preserves global structure of an image during training to be compatible with local details while maintaining the integrity of semantic-aware information by exploiting the powerful long-range dependencies modeling capability of the transformer. We also propose a new scaling formula having scale-invariance during the calculation period, which effectively improves the generated image quality of the OSG model on image super-resolution tasks. We present the design of the TcGAN converter framework, comprehensive experimental as well as ablation studies demonstrating the ability of TcGAN to achieve arbitrary image generation with the fastest running time. Lastly, TcGAN achieves the most excellent performance in terms of applying it to other image processing tasks, e.g., super-resolution as well as image harmonization, the results further prove its superiority.

연구 동기 및 목표

  • CNN 기반 일회성 이미지 생성(OSG) 방법의 한계를 해결하기 위해, 전반적인 구조 유지 및 장거리 상관관계 모델링에 어려움을 겪는 문제를 해결한다.
  • 비전 트랜스포머의 어텐션 메커니즘을 활용하여 기존 OSG 모델의 낮은 일반화 능력과 구조적 일관성 부족 문제를 해결한다.
  • 제한된 데이터로도 실생활 응용에 적합한, 확장 가능하고 빠른 학습이 가능한 임의의 이미지 생성 프레임워크를 개발한다.
  • 추가적인 레이블 없이 스케일 인variant 스케일링을 활용하여 고해상도 이미지 생성 및 이미지 조화를 실현한다.
  • SinGAN, ConSinGAN, PetsGAN과 같은 최신 기술 수준의 OSG 방법보다 더 빠른 학습 속도와 뛰어난 이미지 품질을 달성한다.

제안 방법

  • 장거리 상관관계를 모델링하고 전반적인 이미지 구조를 유지하기 위해 개별 비전 트랜스포머(ViT)를 통합한 새로운 TcGAN 프레임워크를 제안한다.
  • 이미지 초해상도에서 의미 일관성을 유지하기 위해 스케일 인variant 스케일링 공식을 설계하여 재학습이나 레이블 없이도 고정밀도 생성을 가능하게 한다.
  • OSG에서 표준 CNN 기반 특징 추출기를 ViT 기반 인코더로 대체하여 전역적 맥락 모델링을 향상시키고 구조적 잡음을 감소시킨다.
  • SinGAN과 유사한 다중 해상도, 패치 기반 학습 전략을 구현하지만, ViT 기반 특징 학습을 통해 국소적 세부 사항과 전반적 레이아웃을 모두 유지한다.
  • 자기 어텐션을 갖춘 디스criminator를 사용하여 적대적 학습 안정성을 향상시키고 더 현실적인 질감과 구조를 생성한다.
  • 초기화 없이도 슈퍼해상도 및 이미지 조화와 같은 후행 작업에 적용 가능한 TcGAN 컨버터 프레임워크를 통합한다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머 기반 생성자로 일회성 이미지 생성 중 전반적 구조와 의미 일관성을 유지하는 데서 CNN 기반 생성자보다 우수한 성능을 내는가?
  • RQ2제안된 스케일 인variant 스케일링 공식은 추가적인 레이블 없이 어떻게 이미지 초해상도 품질을 향상시키는가?
  • RQ3생성자에 개별 ViT를 통합할 경우 일회성 이미지 생성에서 학습 속도와 추론 품질에 어떤 영향을 미치는가?
  • RQ4TcGAN은 추가 튜닝 없이도 슈퍼해상도 및 이미지 조화와 같은 후행 작업으로 효과적으로 일반화되는가?
  • RQ5SinGAN, ConSinGAN, PetsGAN과 같은 기존 최신 기술 수준의 OSG 방법과 비교해 TcGAN의 학습 효율성과 이미지 품질은 어떠한가?

주요 결과

  • TcGAN은 Places50 데이터셋에서 0.0117의 최저 SIFID 스코어를 기록하여 모든 기준 모델 대비 뛰어난 이미지 품질과 다양성을 보였다.
  • CelebA50 데이터셋에서 TcGAN은 SSIM 0.8882를 기록하여 원본 이미지와 강한 구조적 유사성을 유지하면서도 다양한 샘플을 생성함을 보였다.
  • TcGAN은 평균 학습 시간을 약 10분으로 단축시켜 ConSinGAN보다 1.6배, ExSinGAN보다 2.8배, SinGAN 및 SinDiffusion보다 6.5배 더 빠르게 하였다.
  • TcGAN은 Places50에서 LPIPS 0.0560을 기록하여 생성된 이미지의 고도로 인지 가능한 다양성과 최소한의 중복성을 보였다.
  • TcGAN은 추가적인 레이블 없이도 슈퍼해상도 및 이미지 조화 작업으로 효과적으로 일반화되었으며, 의미 일관성과 구조적 정확성을 유지하였다.
  • 제거 실험 결과, ViT 구성 요소가 전반적 구조 유지에 핵심적임을 확인하였으며, 이를 제거할 경우 성능이 크게 저하됨을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.