[论文解读] Lafite2: Few-shot Text-to-Image Generation
Lafite2 提出了一种新颖的少样本文本到图像生成无监督预训练方法,通过检索增强的构建方式合成伪文本特征,并结合对比潜在优化,实现在完全监督设置下 MS-COCO 数据集上 6.78 的最先进 FID 分数,同时在零样本和少样本设置下以极低的数据和计算成本取得具有竞争力的结果。
Text-to-image generation models have progressed considerably in recent years, which can now generate impressive realistic images from arbitrary text. Most of such models are trained on web-scale image-text paired datasets, which may not be affordable for many researchers. In this paper, we propose a novel method for pre-training text-to-image generation model on image-only datasets. It considers a retrieval-then-optimization procedure to synthesize pseudo text features: for a given image, relevant pseudo text features are first retrieved, then optimized for better alignment. The low requirement of the proposed method yields high flexibility and usability: it can be beneficial to a wide range of settings, including the few-shot, semi-supervised and fully-supervised learning; it can be applied on different models including generative adversarial networks (GANs) and diffusion models. Extensive experiments illustrate the effectiveness of the proposed method. On MS-COCO dataset, our GAN model obtains Fréchet Inception Distance (FID) of 6.78 which is the new state-of-the-art (SoTA) of GANs under fully-supervised setting. Our diffusion model obtains FID of 8.42 and 4.28 on zero-shot and supervised setting respectively, which are competitive to SoTA diffusion models with a much smaller model size.
研究动机与目标
- 为解决在大规模图像-文本配对数据集上训练文本到图像模型所面临的高昂成本和数据需求问题。
- 通过在仅含图像的数据集上实现有效预训练,提升少样本和半监督文本到图像生成性能。
- 开发一种灵活且低资源消耗的方法,适用于包括生成对抗网络(GANs)和扩散模型在内的多种架构。
- 缩小完全监督与无语言(无文本)文本到图像模型之间的性能差距。
提出的方法
- Lafite2 首先利用图像特征从 CLIP 的多模态嵌入空间中检索相关文本特征,以合成伪文本特征。
- 应用对比潜在优化(CLO)对检索到的伪文本特征进行优化,以实现与图像特征更好的对齐。
- 该方法采用检索增强策略,在优化前提升伪文本特征的质量与相关性。
- 通过引入高斯扰动和潜在优化组件,增强预训练过程中模型的鲁棒性与特征质量。
- 该框架被应用于基于生成对抗网络(Lafite2_GAN)和基于扩散模型(Lafite2_LDM)的两种架构。
- 预训练模型通过极少量真实图像-文本对进行微调,从而实现强大的少样本性能。
实验结果
研究问题
- RQ1仅使用图像数据且无配对文本注释,文本到图像模型能否实现强大性能?
- RQ2在缺乏真实配对数据的情况下,如何有效合成伪文本特征以改善图像-文本对齐?
- RQ3在少样本设置下,检索增强的伪文本特征构建是否优于随机或扰动初始化?
- RQ4所提出的方法能否在极低数据量下,同时在完全监督和少样本设置中实现最先进结果?
- RQ5对比潜在优化如何提升伪文本特征的质量与对齐程度?
主要发现
- Lafite2_GAN 在完全监督训练下于 MS-COCO 数据集上实现 6.78 的 Fréchet Inception Distance(FID)分数,创下基于 GAN 模型的新最先进水平。
- Lafite2_LDM 在零样本生成中实现 8.42 的 FID 分数,在监督设置下实现 4.28 的 FID 分数,优于其他无语言模型,且参数量小得多。
- 检索增强组件在低数据场景下显著提升性能,尤其在仅使用 0.1% 至 1% 训练数据时表现突出。
- 对比潜在优化(CLO)提升了图像-文本对应关系,在完全监督设置下将 SOA-I 从基线的 74.48 提升至 74.88。
- 整合所有组件——检索、CLO 和高斯扰动——可获得最佳整体性能,减少过拟合并提升泛化能力。
- 使用 Lafite2 进行预训练后再微调,即使仅使用完整数据集的 10%,其性能也优于从零开始训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。