[논문 리뷰] StyleSwin: Transformer-based GAN for High-resolution Image Generation
StyleSwin는 스위치 윈도우 자기주의 Swin 트랜스포머를 스타일 기반 생성자에 통합하고 이중 주의와 사인 위치 인코딩을 도입하여 수용 영역과 공간 일관성을 향상시킴으로써 고해상도 이미지 생성을 위한 트랜스포머 기반 GAN을 제안한다. 이는 복잡한 훈련 전략 없이도 CelebA-HQ 1024×1024에서 4.43의 FID 점수, FFHQ 1024×1024에서 5.07의 FID 점수를 기록하여 기존의 StyleGAN을 능가하는 최신 기술 수준의 성능을 달성한다.
Despite the tantalizing success in a broad of vision tasks, transformers have not yet demonstrated on-par ability as ConvNets in high-resolution image generative modeling. In this paper, we seek to explore using pure transformers to build a generative adversarial network for high-resolution image synthesis. To this end, we believe that local attention is crucial to strike the balance between computational efficiency and modeling capacity. Hence, the proposed generator adopts Swin transformer in a style-based architecture. To achieve a larger receptive field, we propose double attention which simultaneously leverages the context of the local and the shifted windows, leading to improved generation quality. Moreover, we show that offering the knowledge of the absolute position that has been lost in window-based transformers greatly benefits the generation quality. The proposed StyleSwin is scalable to high resolutions, with both the coarse geometry and fine structures benefit from the strong expressivity of transformers. However, blocking artifacts occur during high-resolution synthesis because performing the local attention in a block-wise manner may break the spatial coherency. To solve this, we empirically investigate various solutions, among which we find that employing a wavelet discriminator to examine the spectral discrepancy effectively suppresses the artifacts. Extensive experiments show the superiority over prior transformer-based GANs, especially on high resolutions, e.g., 1024x1024. The StyleSwin, without complex training strategies, excels over StyleGAN on CelebA-HQ 1024, and achieves on-par performance on FFHQ-1024, proving the promise of using transformers for high-resolution image generation. The code and models will be available at https://github.com/microsoft/StyleSwin.
연구 동기 및 목표
- 순수한 트랜스포머가 고해상도 이미지 생성에서 경쟁적인 성능을 낼 수 있는지 조사한다.
- 이미지 합성에 있어 표준 트랜스포머의 높은 계산 비용과 제한된 수용 영역 문제를 해결한다.
- 고해상도 합성에서 블록 기반 국소 주의로 인해 발생하는 블록 아티팩트를 완화한다.
- 윈도우 기반 자기주의에서 상실된 위치 인덕티브 바이어스를 복원하여 생성 품질을 향상시킨다.
- 트랜스포머가 고해상도 1024×1024에 효과적으로 스케일업되어 고해상도 세부 사항과 전역 일관성을 확보할 수 있음을 보여준다.
제안 방법
- 계산 효율성과 모델링 능력의 균형을 맞추기 위해 이동 윈도우 자기주의를 갖춘 Swin 트랜스포머 블록을 채택한다.
- 각 레이어에서 국소 윈도우와 이동 윈도우 양쪽을 주시하는 이중 주의를 도입하여 효과적 수용 영역을 확대한다.
- 윈도우 기반 주의에서 상실된 절대 위치 인식을 복원하기 위해 각 스케일에 사인 위치 인코딩(SPE)을 통합한다.
- 특히 고해상도 출력에서의 블록 패atters를 포함한 스펙트럼 아티팩트를 탐지하고 억제하기 위해 웨이블릿 판별자를 사용한다.
- 다중 스케일에서 이미지 합성을 제어할 수 있는 학습된 스타일 벡터를 갖춘 스타일 기반 생성자 아키텍처를 채택한다.
- 트랜스포머 기반 GAN에서 일반화를 향상시키고 과적합을 줄이기 위해 bCR(빅 컷 랜덤)를 통한 데이터 증강을 적용한다.
실험 결과
연구 질문
- RQ1순수한 트랜스포머 기반 GAN이 고해상도 이미지 생성에서 최신 기술 수준의 성능을 달성할 수 있는가, 특히 1024×1024 해상도에서?
- RQ2윈도우 기반 트랜스포머의 국소 주의의 제한된 수용 영역을 과도한 계산 비용 없이 효과적으로 확장할 수 있는가?
- RQ3왜 블록 기반 주의를 사용한 고해상도 합성에서 블록 아티팩트가 발생하는가, 그리고 어떻게 이를 완화할 수 있는가?
- RQ4윈도우 기반 트랜스포머에서 절대 위치 정보의 손실이 이미지 생성 품질에 얼마나 큰 영향을 미치는가?
- RQ5웨이블릿 판별자가 생성된 이미지의 스펙트럼 불일치를 분석함으로써 아티팩트를 효과적으로 억제할 수 있는가?
주요 결과
- StyleSwin은 CelebA-HQ 1024×1024에서 FID 4.43을 기록하여 모든 이전의 트랜스포머 기반 GAN을 능가하고, 복잡한 훈련 전략 없이도 StyleGAN을 초월한다.
- FFHQ 1024×1024에서 StyleSwin은 FID 5.07을 기록하여 StyleGAN2의 성능에 가까이 다가가며 트랜스포머 기반 GAN 중 최신 기술 수준을 설정한다.
- 제거 실험 결과, 이중 주의가 FID를 8.40에서 7.86으로 감소시키고, 웨이블릿 판별자가 추가로 6.34로 감소시켜 아티팩트 억제의 효과를 입증한다.
- FFHQ-256에서 사인 위치 인코딩(SPE)을 적용하면 FID가 6.34에서 5.76으로 감소하여 절대 위치 감시의 중요성을 입증한다.
- 40.86M 파라미터를 가진 StyleSwin는 1024×1024에서 50.90B FLOPs만을 소비하며, StyleGAN2의 74.27B FLOPs보다도 낮은 계산 비용을 기록하여 효율성을 입증한다.
- 256×256 해상도에서 FFHQ와 LSUN Church 모두에서 최신 기술 수준의 FID를 달성하여 StyleGAN2와 이전의 트랜스포머 기반 방법을 모두 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.