[论文解读] Scaling up GANs for Text-to-Image Synthesis
本文提出 GigaGAN,一种可扩展的 GAN 架构,通过在大规模文本到图像生成中稳定训练,实现了最先进水平的推理速度和高分辨率图像合成。该模型可在 0.13 秒内生成 512px 图像,3.66 秒内生成 1600 万像素图像,同时支持高级潜在空间编辑,尽管 FID 分数略低,但在速度和可控性方面优于扩散模型。
The recent success of text-to-image synthesis has taken the world by storm and captured the general public's imagination. From a technical standpoint, it also marked a drastic change in the favored architecture to design generative image models. GANs used to be the de facto choice, with techniques like StyleGAN. With DALL-E 2, auto-regressive and diffusion models became the new standard for large-scale generative models overnight. This rapid shift raises a fundamental question: can we scale up GANs to benefit from large datasets like LAION? We find that naÏvely increasing the capacity of the StyleGAN architecture quickly becomes unstable. We introduce GigaGAN, a new GAN architecture that far exceeds this limit, demonstrating GANs as a viable option for text-to-image synthesis. GigaGAN offers three major advantages. First, it is orders of magnitude faster at inference time, taking only 0.13 seconds to synthesize a 512px image. Second, it can synthesize high-resolution images, for example, 16-megapixel pixels in 3.66 seconds. Finally, GigaGAN supports various latent space editing applications such as latent interpolation, style mixing, and vector arithmetic operations.
研究动机与目标
- 探究 GAN 是否可被扩展至大规模文本到图像合成,性能与扩散模型和自回归模型相当。
- 通过引入架构和训练技术的创新,克服大规模 GAN 训练中的不稳定性。
- 实现出色速度与高分辨率的图像生成,并支持可控的潜在空间编辑,如风格混合和提示词插值。
- 开发一种即插即用的基于 GAN 的上采样器,提升扩散模型流程中的图像质量和对齐效果。
- 证明尽管扩散模型和自回归模型占据主导地位,GAN 仍适用于大规模生成建模。
提出的方法
- 提出基于滤波器组的生成器架构,可在保持训练稳定性的同时实现有效容量扩展。
- 在卷积块中引入交错的自注意力与交叉注意力层,以提升图像-文本对齐与特征表示。
- 采用多尺度训练方案,增强低频细节学习并改善图像-文本对齐。
- 使用两阶段生成流程:先生成 64×64 图像,再通过文本条件化的基于 GAN 的上采样器上采样至 512×512。
- 应用来自扩散模型的技术(如跳跃连接和归一化)以在大规模训练中稳定 GAN 训练。
- 利用解耦的潜在空间,分离文本嵌入(t)与风格码(w),以实现可控图像操作。
实验结果
研究问题
- RQ1GAN 是否可成功扩展至参数量达十亿的模型,用于开放世界文本到图像合成,且不牺牲训练稳定性?
- RQ2在 LAION2B-en 等多样化数据集上,为稳定大规模 GAN 训练,需要哪些架构与训练修改?
- RQ3在推理速度、图像质量与可控性方面,扩展后的 GAN 与扩散模型和自回归模型相比表现如何?
- RQ4基于 GAN 的上采样器是否可有效用作扩散模型流程中的高质量、文本条件化超分辨率模块?
- RQ5在大规模 GAN 中,风格混合与提示词插值等潜在空间编辑技术能在多大程度上被保留并增强?
主要发现
- GigaGAN 在 COCO2014 上实现零样本 FID 为 9.09,尽管参数量更少,仍优于 DALL·E 2 和 Parti-750M。
- 模型仅用 0.13 秒即可生成 512px 图像,推理速度比自回归模型和扩散模型快数个数量级。
- GigaGAN 在 3.66 秒内生成 1600 万像素图像,展现出其在超高分辨率生成方面的强大能力。
- 基于 GAN 的上采样器在 8 倍超分辨率任务中表现更优,FID、CLIP 分数与 LPIPS 均优于文本条件化(SD Upscaler)与无条件(Real-ESRGAN)基线。
- 该模型支持高级潜在空间操作,如风格混合、提示词插值与向量运算,在解耦的 W 空间中保持可控性。
- 尽管 FID 略低于最先进模型,GigaGAN 证明 GAN 可扩展至十亿参数模型,实现稳定训练与极高的推理效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。