Skip to main content
QUICK REVIEW

[논문 리뷰] STransGAN: An Empirical Study on Transformer in GANs

Rui Xu, Xiangyu Xu|arXiv (Cornell University)|2021. 10. 25.
Generative Adversarial Networks and Image Synthesis인용 수 8
한 줄 요약

이 논문은 국소적 어텐션과 재구조화된 잔차 연결을 활용하여, CNN을 사용하지 않는 Transformer 기반 생성자와 판별자인 STrans-G와 STrans-D를 제안한다. 이 방법은 무조건적 및 조건부 생성 작업 모두에서 경쟁적인 이미지 합성 성능를 달성하며, Transformer 기반과 CNN 기반 판별자 간의 정확도 격차를 크게 줄였다.

ABSTRACT

Transformer becomes prevalent in computer vision, especially for high-level vision tasks. However, deploying Transformer in the generative adversarial network (GAN) framework is still an open yet challenging problem. In this paper, we conduct a comprehensive empirical study to investigate the intrinsic properties of Transformer in GAN for high-fidelity image synthesis. Our analysis highlights the importance of feature locality in image generation. We first investigate the effective ways to implement local attention. We then examine the influence of residual connections in self-attention layers and propose a novel way to reduce their negative impacts on learning discriminators and conditional generators. Our study leads to a new design of Transformers in GAN, a convolutional neural network (CNN)-free generator termed as STrans-G, which achieves competitive results in both unconditional and conditional image generations. The Transformer-based discriminator, STrans-D, also significantly reduces its gap against the CNN-based discriminators.

연구 동기 및 목표

  • 고해상도 이미지 합성을 위한 GAN 내에서 Transformer의 내재적 성질을 탐구하기 위해.
  • 특히 판별력과 생성 품질을 유지하는 데 어려움을 겪는 GAN 내에서 Transformer를 구현하는 데 도전하기 위해.
  • GAN 내에서 Transformer 기반과 CNN 기반 판별자 간의 성능 격차를 줄이기 위해.
  • 기존의 CNN 기반 대체품과 경쟁하거나 그에 못지않는 성능을 내는 CNN을 사용하지 않는 생성자와 판별자를 설계하기 위해.

제안 방법

  • 이미지 생성에 핵심적인 기능 국소성을 유지하기 위해 국소적 자기어텐션 메커니즘을 구현하기 위해.
  • 자기어텐션 레이어 내의 잔차 연결을 재설계하여 판별자 및 조건부 생성자 학습에 미치는 부정적 영향을 최소화하기 위해.
  • 수정된 Transformer 아키텍처를 기반으로 한 CNN을 사용하지 않는 생성자인 STrans-G를 제안하여 무조건적 및 조건부 이미지 생성을 위해.
  • 성능 면에서 기존의 CNN 기반 대체품과 동등하거나 이를 초월하는 Transformer 기반 판별자인 STrans-D를 설계하기 위해.
  • 국소적 어텐션과 잔차 연결 수정의 기여도를 평가하기 위해 광범위한 아블레이션 연구를 수행하기 위해.
  • 무조건적 및 조건부 이미지 합성에 대해 표준 벤치마크에서 제안된 모델을 훈련하고 평가하기 위해.

실험 결과

연구 질문

  • RQ1국소적 어텐션은 Transformer 기반 GAN 내에서 이미지 생성 품질에 어떤 영향을 미치는가?
  • RQ2잔차 연결은 Transformer 기반 GAN 내에서 판별자 및 조건부 생성자의 학습 역학에 어떤 영향을 미치는가?
  • RQ3CNN을 사용하지 않는 생성자와 판별자는 고해상도 이미지 합성에서 기존의 CNN 기반 대체품과 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ4어텐션과 잔차 연결에 대한 아키텍처 수정은 GAN 내에서 Transformer의 안정성과 성능을 어떻게 향상시키는가?

주요 결과

  • 국소적 어텐션 메커니즘은 Transformer 기반 GAN 내에서 기능 표현과 이미지 품질을 크게 향상시킨다.
  • 다시 설계된 잔차 연결은 판별자 및 생성자 학습에 간섭을 줄여 더 안정적인 학습을 가능하게 한다.
  • STrans-G는 컨volution 레이어를 사용하지 않아도 무조건적 및 조건부 이미지 생성에서 경쟁적인 성능를 달성한다.
  • STrans-D는 CNN 기반 판별자와의 성능 격차를 줄이며 순수한 Transformer 설계에서 강력한 판별 능력을 입증한다.
  • 아블레이션 연구는 국소적 어텐션과 수정된 잔차 연결이 고해상도 이미지 합성에 있어 필수적임을 확인한다.
  • 제안된 STransGAN 프레임워크는 표준 벤치마크에서 CNN을 사용하지 않는 Transformer 기반 GAN 중 최고 성능를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.