[论文解读] GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models
GLIDE 训练一个 3.5B 参数的文本条件扩散模型,并比较无分类器引导与 CLIP 指导的采样,结果是无分类器引导在写实性和标题对齐方面产生更好的图像;它还展示文本驱动的修复式编辑(inpainting)并发布了一个经过筛选的更小模型以提升安全性。
Diffusion models have recently been shown to generate high-quality synthetic images, especially when paired with a guidance technique to trade off diversity for fidelity. We explore diffusion models for the problem of text-conditional image synthesis and compare two different guidance strategies: CLIP guidance and classifier-free guidance. We find that the latter is preferred by human evaluators for both photorealism and caption similarity, and often produces photorealistic samples. Samples from a 3.5 billion parameter text-conditional diffusion model using classifier-free guidance are favored by human evaluators to those from DALL-E, even when the latter uses expensive CLIP reranking. Additionally, we find that our models can be fine-tuned to perform image inpainting, enabling powerful text-driven image editing. We train a smaller model on a filtered dataset and release the code and weights at https://github.com/openai/glide-text2im.
研究动机与目标
- 在大规模(3.5B 参数)的扩散模型下推进文本条件图像合成,同时评估用于保真度和标题对齐的引导策略。
- 展示使用扩散模型进行文本驱动的图像编辑和修复性填充(inpainting)。
- 评估安全影响并提供一个经过筛选的发布版本以降低滥用风险。
提出的方法
- 训练一个以自然语言提示为条件的 3.5B 参数文本条件扩散模型。
- 比较无分类器引导与 CLIP 引导在噪声图像上的扩散引导效果。
- 对模型进行针对性微调,以掩码条件实现图像修复式填充,支持文本驱动的编辑。
- 在清洗数据集上训练一个更小的、经过筛选的 GLIDE(filtered)模型以降低滥用风险。
- 训练一个带噪声的 CLIP 模型,使其能够对带噪声的输入进行 CLIP 指导的扩散。
实验结果
研究问题
- RQ1在写实性和标题相似性方面,无分类器引导是否在文本条件扩散中优于 CLIP 引导?
- RQ2扩散模型能否在没有独立分类器的情况下有效引导实现高质量的文本条件生成?
- RQ3模型在自然语言提示驱动的图像修复/编辑方面的表现如何?
- RQ4哪些安全措施(数据筛选、较小的经过筛选的模型)可以降低误用如虚假信息或深度伪造的风险?
- RQ5在人工评估中,GLIDE 相对于早期文本到图像模型(如 DALL-E)的表现如何?
主要发现
- 在人工评估中,无分类器引导产出更高质量、更加写实的图像,并且标题对齐性更好,比 CLIP 引导更优。
- 在某些设定下,带有无分类器引导的 GLIDE 样本优于 DALL-E(在某些设定下,87% 写实度,69% 标题相似度)。
- GLIDE 在无需 MS-COCO 特定训练的情况下实现具有竞争力的 MS-COCO FID(12.24),在筛选评估下也表现强劲(12.89)。
- GLIDE 实现的文本条件修复填充可匹配周围风格和照明,包括阴影和反射。
- 发布了一个更小的经过筛选的 GLIDE 模型以降低滥用风险,数据筛选去除了人物以及某些暴力/仇恨内容;红队评估表明从筛选数据中生成可识别的人体图像的能力有限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。