[论文解读] ERNIE-ViLG: Unified Generative Pre-training for Bidirectional Vision-Language Generation
ERNIE-ViLG 展示了一个统一的 10B 参数变换器,能够自回归地对图像到文本和文本到图像生成进行建模,使用离散图像表示,并提供用于文本到图像合成的端到端训练选项,以及对中文大规模图像文本预训练。
Conventional methods for the image-text generation tasks mainly tackle the naturally bidirectional generation tasks separately, focusing on designing task-specific frameworks to improve the quality and fidelity of the generated samples. Recently, Vision-Language Pre-training models have greatly improved the performance of the image-to-text generation tasks, but large-scale pre-training models for text-to-image synthesis task are still under-developed. In this paper, we propose ERNIE-ViLG, a unified generative pre-training framework for bidirectional image-text generation with transformer model. Based on the image quantization models, we formulate both image generation and text generation as autoregressive generative tasks conditioned on the text/image input. The bidirectional image-text generative modeling eases the semantic alignments across vision and language. For the text-to-image generation process, we further propose an end-to-end training method to jointly learn the visual sequence generator and the image reconstructor. To explore the landscape of large-scale pre-training for bidirectional text-image generation, we train a 10-billion parameter ERNIE-ViLG model on a large-scale dataset of 145 million (Chinese) image-text pairs which achieves state-of-the-art performance for both text-to-image and image-to-text tasks, obtaining an FID of 7.9 on MS-COCO for text-to-image synthesis and best results on COCO-CN and AIC-ICC for image captioning.
研究动机与目标
- 在单一自回归 Transformer 框架内激励并实现双向视觉-语言生成。
- 使用 VQVAE/VQGAN 基于标记化学习的离散图像表示,统一图像到文本与文本到图像生成。
- 提出端到端的文本到图像合成训练方法,以共同优化生成器和重构器。
- 在大规模中文图像文本数据集上将预训练扩展到 10B 参数,以在生成方向和生成性 VQA 上达到 SOTA。
- 通过定性和定量实验证明强烈的跨模态语义对齐。
提出的方法
- 通过 VQVAE/VQGAN 基于标记化将图像表示为离散序列,并将它们与文本标记作为输入传递给共享的 Transformer。
- 使用特定的自注意力掩码,在同一模型中将图像到文本和文本到图像生成建模为自回归任务。
- 对于文本到图像,引入一个端到端训练路径,将 Transformer 的隐藏嵌入映射到图像标记并通过图像重构器反向传播。
- 在训练和推理阶段使用稀疏注意力(行/列/卷积)来高效管理较长的视觉序列(n ~ 1024)。
- 在从中文网页、图像搜索数据和公开 CC/CC12M 派生的字幕中收集的 145M Chinese image-text 对数据集上预训练一个 10B 参数模型。
- 在规模较大时采用两阶段文本到图像训练以稳定训练的类似 GAN 的组件,并在较小规模上与端到端变体进行比较。
实验结果
研究问题
- RQ1能否在单一自回归 Transformer 模型中有效地统一双向的图像-文本生成?
- RQ2在大规模中文图像文本数据集上进行联合预训练是否会在文本到图像合成和图像字幕任务上都达到最先进的结果?
- RQ3端到端的文本到图像合成训练方法是否比传统的两阶段流程在生成器和重构器性能上有所提升?
- RQ4通过 VQVAE/VQGAN 的离散视觉表示如何影响跨模态生成质量和对齐?
- RQ5统一的双向模型是否将其语义对齐能力扩展到生成性视觉问答(VQA)?
主要发现
- ERNIE-ViLG 在 MS-COCO 的文本到图像合成上达到最先进的 Fréchet Inception Distance (FID) 7.9。
- 在零-shot 文本到图像生成中,ERNIE-ViLG 获得 FID 14.7,优于 DALL-E (27.5)。
- 在图像字幕方面,ERNIE-ViLG 在 COCO-CN 和 AIC-ICC 数据集上通过 BLEU@4、METEOR、ROUGE-L 和 CIDERr 指标实现最佳结果。
- 人工评估显示 ERNIE-ViLG 在零-shot 图像生成的图像清晰度、纹理和文本相关性方面优于 CogView,并在微调后在 COCO-CN 上获得更高的字幕质量。
- 端到端的文本到图像训练方法在 lite 模型中比两阶段管线将 FID 提升约 1.5 点,端到端 G 与端到端 R 的组合在重建质量上显示出最强提升。
- 该模型在生成性 VQA 方面表现出强大的能力,在 FMIQA 的 Turing Test 通过率为 78.5%,平均质量分数为 1.495。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。