[논문 리뷰] Styleformer: Transformer based Generative Adversarial Networks with Style Vector
Styleformer는 GAN에 기반한 생성자로, 스타일 벡터와 새로운 Attention Style Injection 모듈을 사용하여 장거리 의존성과 전반적인 객체 구조를 모델링한다. 이는 단일 객체 및 복합 시나리오 생성에서 최신 기술을 초월한다. 선형 복잡도 변형(Styleformer-L)과 트랜스포머의 효율성과 StyleGAN2의 세부 사양 보정을 융합한 하이브리드 아키텍처(Styleformer-C)를 통해 최고 성능을 달성한다.
We propose Styleformer, which is a style-based generator for GAN architecture, but a convolution-free transformer-based generator. In our paper, we explain how a transformer can generate high-quality images, overcoming the disadvantage that convolution operations are difficult to capture global features in an image. Furthermore, we change the demodulation of StyleGAN2 and modify the existing transformer structure (e.g., residual connection, layer normalization) to create a strong style-based generator with a convolution-free structure. We also make Styleformer lighter by applying Linformer, enabling Styleformer to generate higher resolution images and result in improvements in terms of speed and memory. We experiment with the low-resolution image dataset such as CIFAR-10, as well as the high-resolution image dataset like LSUN-church. Styleformer records FID 2.82 and IS 9.94 on CIFAR-10, a benchmark dataset, which is comparable performance to the current state-of-the-art and outperforms all GAN-based generative models, including StyleGAN2-ADA with fewer parameters on the unconditional setting. We also both achieve new state-of-the-art with FID 15.17, IS 11.01, and FID 3.66, respectively on STL-10 and CelebA. We release our code at https://github.com/Jeeseung-Park/Styleformer.
연구 동기 및 목표
- 복잡한 시나리오에서 장거리 의존성과 전반적인 구조를 모델링하는 데에 한계를 보이는 CNN 기반 GAN의 문제를 해결하기 위해.
- 표준 트랜스포머의 이차원 계산 복잡도 문제를 해결하기 위해 선형 복잡도 변형을 도입함으로써 고해상도 이미지 생성에서의 계산 비용을 줄이기 위해.
- 높은 정밀도와 고해상도 이미지 생성을 가능하게 하며, 전반적인 구성과 국소적 세부 사양에 대한 제어를 향상시키기 위해.
- 자기주의 어텐션 기반의 구조적 관계를 다중 객체 및 복합 시나리오에서 효과적으로 포착할 수 있는지 입증하기 위해.
- 주의 기반 스타일 조절을 사용하여 CNN 기반 생성자에 비해 확장 가능하고 효율적이며 안정적인 대안을 제공하기 위해.
제안 방법
- 훈련 안정성과 장거리 모델링을 향상시키기 위해 다중 헤드 어텐션을 강화하고 사전 레이어 정규화를 적용한 트랜스포머 인코더를 변형한다.
- 자기주의 어텐션 연산에 특화된 스타일 조절 및 디모듈레이션 메커니즘인 Attention Style Injection 모듈을 도입한다.
- 자기주의 어텐션 복잡도를 이차원에서 선형으로 줄이기 위해 Linformer를 적용함으로써 고해상도 이미지 생성을 가능하게 한다(Styleformer-L).
- 저해상도에서의 Styleformer와 고해상도에서의 StyleGAN2를 융합한 아키텍처(Styleformer-C)를 구현함으로써 트랜스포머의 전반적 구조 모델링 능력과 StyleGAN2의 세부 사양 보정 능력을 동시에 활용한다.
- 스타일 믹싱과 어텐션 맵 시각화를 통해 전역적 구조와 텍스처/색상 간의 분리 능력을 분석하고 검증한다.
- 어텐션 맵에 대한 특이값 분해를 수행하여 낮은 질서의 구조를 확인함으로써 Linformer의 시각적 합성에 대한 타당성을 입증한다.

실험 결과
연구 질문
- RQ1스타일 벡터를 갖춘 트랜스포머 기반 생성자가 이미지 생성에서 장거리 의존성과 전반적인 객체 구조를 효과적으로 모델링할 수 있는가?
- RQ2고해상도 이미지 생성에서 자기주의 어텐션의 계산 비용을 성능 손실 없이 선형 복잡도로 줄일 수 있는가?
- RQ3트랜스포머 기반 생성자와 CNN 기반 정밀 조절 헤드를 융합하면 복합 시나리오에서 생성 품질이 향상되는가?
- RQ4어텐션 맵과 스타일 믹싱 결과를 통해 모델이 전역적 구조와 국소적 텍스처 및 색상 간의 분리를 성공적으로 수행하는가?
- RQ5단일 객체 및 다중 객체 데이터셋에서 최신 기술 GAN과 비교해 FID 및 IS 측정치에서 본 모델의 성능은 어떠한가?
주요 결과
- CIFAR-10에서 무조건적 생성 조건 하에서 Styleformer는 FID 2.82와 IS 10.00을 기록하여, StyleGAN2-ADA를 포함한 모든 GAN 기반 모델을 능가한다.
- CelebA 데이터셋에서 Styleformer-L은 메모리 사용량을 약 3배 줄이고 추론 속도를 1.3배 향상시키며, FID를 3.92에서 3.36으로 개선한다.
- CLEVR 데이터셋에서 Styleformer-C는 FID 11.67과 IS 2.27을 기록하여, 다중 객체 시나리오 생성에서 StyleGAN2(FID 16.05)를 능가한다.
- Cityscapes 데이터셋에서 Styleformer-C는 FID 5.99와 IS 2.56을 기록하여, 복합 시나리오 합성에서 StyleGAN2(FID 8.35)를 크게 앞서간다.
- 스타일 믹싱 결과는 저해상도 스타일 벡터가 객체 레이아웃과 구조를 제어하고, 고해상도 스타일 벡터가 색상과 텍스처를 제어함을 확인하여 분리 능력을 입증한다.
- 어텐션 맵 시각화 결과는 자기주의 어텐션이 객체 위치에 집중함을 확인하여 효과적인 장거리 상호작용과 전반적 구조 모델링 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.