[论文解读] Styleformer: Transformer based Generative Adversarial Networks with Style Vector
Styleformer 提出了一种基于 Transformer 的 GAN 生成器,采用风格向量和一种新颖的注意力风格注入模块,以建模长距离依赖关系和全局物体结构,在单物体和组合场景生成任务中均超越了当前最先进模型。通过线性复杂度变体(Styleformer-L)和结合 Transformer 效率与 StyleGAN2 细节优化的混合架构(Styleformer-C),实现了最先进性能。
We propose Styleformer, which is a style-based generator for GAN architecture, but a convolution-free transformer-based generator. In our paper, we explain how a transformer can generate high-quality images, overcoming the disadvantage that convolution operations are difficult to capture global features in an image. Furthermore, we change the demodulation of StyleGAN2 and modify the existing transformer structure (e.g., residual connection, layer normalization) to create a strong style-based generator with a convolution-free structure. We also make Styleformer lighter by applying Linformer, enabling Styleformer to generate higher resolution images and result in improvements in terms of speed and memory. We experiment with the low-resolution image dataset such as CIFAR-10, as well as the high-resolution image dataset like LSUN-church. Styleformer records FID 2.82 and IS 9.94 on CIFAR-10, a benchmark dataset, which is comparable performance to the current state-of-the-art and outperforms all GAN-based generative models, including StyleGAN2-ADA with fewer parameters on the unconditional setting. We also both achieve new state-of-the-art with FID 15.17, IS 11.01, and FID 3.66, respectively on STL-10 and CelebA. We release our code at https://github.com/Jeeseung-Park/Styleformer.
研究动机与目标
- 解决基于 CNN 的 GAN 在建模复杂场景中长距离依赖关系和全局结构方面的局限性。
- 通过引入线性复杂度变体,克服标准 Transformer 在图像生成中二次方计算成本的问题。
- 实现高保真度、高分辨率的图像生成,同时提升对全局构图和局部细节的控制能力。
- 证明自注意力机制在捕捉多物体和组合场景中结构关系方面的有效性。
- 为 GAN 中的基于 CNN 的生成器提供一种可扩展、高效且稳定的基于注意力的风格调制替代方案。
提出的方法
- 通过增加多头注意力机制和预层归一化,改进 Transformer 编码器,以提升训练稳定性和长距离建模能力。
- 引入注意力风格注入模块,一种专为自注意力操作设计的风格调制与去调制机制。
- 应用 Linformer 将自注意力复杂度从二次方降低至线性,从而实现高分辨率图像生成(Styleformer-L)。
- 将低分辨率的 Styleformer 与高分辨率的 StyleGAN2 结合(Styleformer-C),利用 Transformer 建模全局结构,同时借助 StyleGAN2 实现精细细节优化。
- 使用风格混合和注意力图可视化分析与验证模型在全局结构与纹理/颜色之间实现解耦的能力。
- 对注意力图进行奇异值分解,确认其低秩结构,从而为在视觉合成中使用 Linformer 提供理论依据。

实验结果
研究问题
- RQ1基于风格向量的 Transformer 生成器能否有效建模图像生成中的长距离依赖关系和全局物体结构?
- RQ2能否在不损失性能的前提下,将高分辨率图像生成中自注意力机制的计算成本降低至线性复杂度?
- RQ3将基于 Transformer 的生成器与基于 CNN 的细化头结合,是否能提升组合场景下的生成质量?
- RQ4注意力图和风格混合结果能否证明模型成功实现全局结构与局部纹理及颜色的解耦?
- RQ5在单物体和多物体数据集上,该方法与当前最先进 GAN 模型在 FID 和 IS 指标上的表现如何比较?
主要发现
- 在无条件生成设置下,Styleformer 在 CIFAR-10 上达到 FID 2.82 和 IS 10.00,优于所有基于 GAN 的模型,包括 StyleGAN2-ADA。
- 与标准 Styleformer 相比,Styleformer-L 在 CelebA 上将显存使用量减少约 3 倍,推理速度提升 1.3 倍,同时将 FID 从 3.92 提升至 3.36。
- 在 CLEVR 数据集上,Styleformer-C 达到 FID 11.67 和 IS 2.27,优于 StyleGAN2(FID 16.05),在多物体场景生成中表现更优。
- 在 Cityscapes 数据集上,Styleformer-C 达到 FID 5.99 和 IS 2.56,显著优于 StyleGAN2(FID 8.35),在组合场景合成中表现更佳。
- 风格混合结果表明,低分辨率风格向量控制物体布局与结构,而高分辨率风格向量控制颜色与纹理,证实了模型的解耦能力。
- 注意力图可视化结果表明,自注意力机制聚焦于物体位置,证明了其在有效建模长距离交互和全局结构方面的优势。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。