Skip to main content
QUICK REVIEW

[论文解读] CogView2: Faster and Better Text-to-Image Generation via Hierarchical Transformers

Ming Ding, Wendi Zheng|arXiv (Cornell University)|Apr 28, 2022
Multimodal Machine Learning Applications被引用 121
一句话总结

CogView2 使用分层 transformers、局部并行自回归生成以及跨模态通用语言模型(CogLM)来加速高分辨率文本到图像生成,取得与 DALL-E-2 相竞争的结果并实现交互式编辑。

ABSTRACT

The development of the transformer-based text-to-image models are impeded by its slow generation and complexity for high-resolution images. In this work, we put forward a solution based on hierarchical transformers and local parallel auto-regressive generation. We pretrain a 6B-parameter transformer with a simple and flexible self-supervised task, Cross-modal general language model (CogLM), and finetune it for fast super-resolution. The new text-to-image system, CogView2, shows very competitive generation compared to concurrent state-of-the-art DALL-E-2, and naturally supports interactive text-guided editing on images.

研究动机与目标

  • 推动在更高分辨率下更快、可扩展的文本到图像生成。
  • 开发一个统一的预训练框架(CogLM),能够双向处理文本和图像标记。
  • 实现分层生成,以将低分辨率和高分辨率处理分离以提高效率。
  • 引入本地并行自回归细化(LoPAR)以加速高分辨率图像合成。

提出的方法

  • 提出 CogLM:一个6B参数的跨模态变换器预训练,包含文本和图像标记以及基于掩码的自回归预测。
  • 使用两种基于掩码的预训练任务:全图像标记掩码(文本到图像)以及带文本掩码的混合图像块(填充和字幕生成)。
  • 采用分层生成管线:1) 生成 20x20 标记的低分辨率图像,2) 通过直接超分辨率映射到 60x60 标记,3) 通过迭代的 LoPAR 基于超分辨率进行细化。
  • 使用自定义 CUDA 内核实现 2D 局部注意力,以加速超分辨率和细化过程中的局部计算。
  • 通过基于簇的图像标记采样和文本注意力增权技术来提升文本-图像相关性,从而提高采样和训练效率。

实验结果

研究问题

  • RQ1跨模态、双向预训练目标是否能够提升文本到图像模型的生成和下游任务?
  • RQ2将分层生成管线与局部注意力和 LoPAR 结合,是否能够在不牺牲质量的前提下实现快速的高分辨率图像合成?
  • RQ3有针对性的注意力机制和采样策略是否能够提升生成图像对输入文本的保真度和相关性?

主要发现

  • CogView2 在与最先进方法的比较中实现具有竞争力的 Fréchet Inception Distance (FID) 和 Inception Score (IS),在 MS-COCO 上未进行 COCO 微调时,FID-0 约为 24.0,IS 约为 22.4。
  • 在 MS-COCO 上对 CogLM 进行微调可将 FID 提升至 17.5(FID-0),并在其他尺度上降低 FID(例如 FID-4 为 10.6,FID-8 为 10.4),但某些场景下的人类评估可能更偏好未微调的模型。
  • 使用 LoPAR 的分层生成在高分辨率生成中显著提速(比 CogView 风格的自回归生成最快可达 600 倍),同时保持或提升图像质量。
  • 用于标记生成的簇采样缓解了大词汇表中的不完整截断,提升采样连贯性。
  • 基于 CUDA 的局部注意力加速了 2D 局部注意力,在自回归场景下比全注意力快高达 40 倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。