Skip to main content
QUICK REVIEW

[논문 리뷰] The Nuts and Bolts of Adopting Transformer in GANs

Rui Xu, Xiangyu Xu|arXiv (Cornell University)|2021. 10. 25.
Generative Adversarial Networks and Image Synthesis인용 수 6
한 줄 요약

이 논문은 STransGAN을 제안하며, Swin 유사 블록을 통한 특징 국소성 통합, 판별기에서 유해한 잔차 연결 제거, 그리고 스위프로젝션과 조건부 정규화를 사용하여 클래스 정보를 유지함으로써 고해상도 이미지 합성에서 최신 기술 성능을 달성하는 Transformer 기반 GAN 프레임워크이다. CelebA에서 FID 2.03, FFHQ-256에서 FID 4.84를 기록하여 처음으로 성공한 조건부 Transformer GAN임을 입증한다.

ABSTRACT

Transformer becomes prevalent in computer vision, especially for high-level vision tasks. However, adopting Transformer in the generative adversarial network (GAN) framework is still an open yet challenging problem. In this paper, we conduct a comprehensive empirical study to investigate the properties of Transformer in GAN for high-fidelity image synthesis. Our analysis highlights and reaffirms the importance of feature locality in image generation, although the merits of the locality are well known in the classification task. Perhaps more interestingly, we find the residual connections in self-attention layers harmful for learning Transformer-based discriminators and conditional generators. We carefully examine the influence and propose effective ways to mitigate the negative impacts. Our study leads to a new alternative design of Transformers in GAN, a convolutional neural network (CNN)-free generator termed as STrans-G, which achieves competitive results in both unconditional and conditional image generations. The Transformer-based discriminator, STrans-D, also significantly reduces its gap against the CNN-based discriminators.

연구 동기 및 목표

  • 고해상도 이미지 생성을 위한 GAN에서 Transformer를 도입하는 데 있어 기존 시도가 불안정성과 낮은 성능으로 실패한 이유를 해결하기 위해.
  • 분류 작업에서 성공한 표준 Transformer 설계가 왜 GAN, 특히 판별기와 조건부 생성기에서 성능이 열 劣하는지 조사하기 위해.
  • 자기주의 어텐션 메커니즘에서 효과적이지 않은 조건부 주입 및 해로운 잔차 연결과 같은 핵심 아키텍처적 함정을 특정하고 해결하기 위해.
  • CNN 기반 GAN과의 성능 격차를 줄이기 위해 CNN을 사용하지 않는 생성기(STrans-G)와 경쟁력 있는 판별기(STrans-D)를 개발하기 위해.
  • 효과적인 Transformer 기반 GAN을 구축하기 위한 실용적이고 경험적으로 검증된 설계 원칙(‘나사와 볼트’)을 수립하기 위해.

제안 방법

  • 표준 Transformer에서 전역 자기주의 어텐션을 대체하기 위해 특징 국소성에 대한 인덕티브 바이어스를 통합하기 위해 Swin 유사 국소 어텐션 블록을 도입한다.
  • 자기주의 어텐션 레이어 내 표준 잔차 연결을 스위프로젝션 레이어로 대체하여 판별기에서 정보 흐름의 지배를 방지하고 학습 안정성을 향상시킨다.
  • 클래스 레이블을 생성기의 주 흐름에 직접 주입하는 AdaNorm-T라는 조건부 정규화 전략을 제안하며, 이는 조건부 정보가 유지되도록 보장한다.
  • 상대적 위치 인코딩과 국소 윈도우 분할을 사용하여 계산 비용을 줄이고 고해상도 환경에서의 특징 통신을 향상시킨다.
  • 학습 안정성을 높이기 위해 기존의 데이터 증강 기법을 미분 가능하게 수정하고 정규화 스케줄링을 신중히 설정한 수정된 학습 프로토콜을 사용한다.
  • 설계 선택 사항을 검증하기 위해 아블레이션 스터디와 노름 비율 분석을 수행하였으며, 특히 판별기에서 잔차 연결의 부정적 영향을 규명하였다.

실험 결과

연구 질문

  • RQ1표준 Transformer 아키텍처는 이미지 분류에서는 효과적이지만, 이미지 생성을 위한 GAN에 직접 적용했을 때 성능이 열 劣하는 이유는 무엇인가?
  • RQ2특징 국소성이 GAN 기반 이미지 합성에서 Transformer의 성능에 미치는 영향은 무엇이며, 이를 최적으로 구현하는 방법은 무엇인가?
  • RQ3자기주의 어텐션 레이어에서 잔차 연결이 왜 Transformer 기반 판별기와 조건부 생성기의 학습 및 성능을 해칠 수 있는가?
  • RQ4잔차 단절선이 정보를 우회할 수 있도록 하지 않으면서, 조건부 클래스 정보를 Transformer 기반 생성기에 효과적으로 주입하는 전략은 무엇인가?
  • RQ5CNN 기반 GAN의 성능을 따라잡거나 초월할 수 있는 CNN을 사용하지 않는 생성기와 경쟁력 있는 판별기를 Transformer를 사용해 설계할 수 있는가?

주요 결과

  • 국소 어텐션을 갖춘 Swin 레이어는 전역 자기주의 어텐션과 다른 국소화된 어텐션 메커니즘보다 우수한 성능을 보이며, CelebA에서 FID 2.03, FFHQ-256에서 FID 4.84를 기록한다.
  • 자기주의 어텐션 레이어에서의 잔차 연결은 판별기에서 정보 흐름을 지배하여 하위 레이어가 우회되며 성능 저하를 초래한다. 이는 스위프로젝션 레이어로 교체함으로써 완화된다.
  • 생성기의 잔차 경로에 조건부 정보를 주입하면 성능이 열 劣하는 이유는 단절선의 지배 때문이며, AdaNorm-T를 통해 주 흐름에 조건부 정보를 주입하면 CIFAR10에서 Inception 스코어가 10.14에서 11.62로 향상된다.
  • 제안된 STrans-G 생성기는 FFHQ-256에서 FID 4.84, CelebA에서 FID 2.03를 기록하며, 처음으로 성공한 조건부 Transformer GAN임을 입증한다.
  • STrans-D 판별기는 CNN 기반 판별기와의 성능 격차를 크게 줄이며, 더 뛰어난 안정성과 품질을 보여준다.
  • 아블레이션 스터디 결과, 정규화 레이어의 선택과 아키텍처 구성(예: 블록 끝에 AdaNorm가 있는 config-c)이 모드 붕괴를 방지하고 고품질 생성을 달성하는 데 핵심적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.