Skip to main content
QUICK REVIEW

[论文解读] DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models

Zijie J. Wang, Evan Montoya|arXiv (Cornell University)|Oct 26, 2022
Generative Adversarial Networks and Image Synthesis被引用 12
一句话总结

本文介绍了DiffusionDB,一个6.5TB的大型数据集,包含1400万张由Stable Diffusion生成的文本到图像图像,涵盖180万个独特提示词及完整的超参数元数据。该数据集支持对提示工程、模型行为及滥用模式的系统性研究,揭示了由超参数引发的错误以及生成虚假信息的证据,数据集以CC0许可发布,适用于广泛的研究用途。

ABSTRACT

With recent advancements in diffusion models, users can generate high-quality images by writing text prompts in natural language. However, generating images with desired details requires proper prompts, and it is often unclear how a model reacts to different prompts or what the best prompts are. To help researchers tackle these critical challenges, we introduce DiffusionDB, the first large-scale text-to-image prompt dataset totaling 6.5TB, containing 14 million images generated by Stable Diffusion, 1.8 million unique prompts, and hyperparameters specified by real users. We analyze the syntactic and semantic characteristics of prompts. We pinpoint specific hyperparameter values and prompt styles that can lead to model errors and present evidence of potentially harmful model usage, such as the generation of misinformation. The unprecedented scale and diversity of this human-actuated dataset provide exciting research opportunities in understanding the interplay between prompts and generative models, detecting deepfakes, and designing human-AI interaction tools to help users more easily use these models. DiffusionDB is publicly available at: https://poloclub.github.io/diffusiondb.

研究动机与目标

  • 为解决文本到图像扩散模型中有效提示工程的挑战,用户因依赖试错法且缺乏系统性指导而难以生成期望输出。
  • 提供一个大规模、真实用户生成的数据集,记录提示词、超参数与图像输出之间的相互作用,以支持对模型行为的实证分析。
  • 识别导致模型错误或有害输出(如虚假信息或非自愿内容)的提示词模式与超参数配置。
  • 通过支持提示优化、模型可解释性及深度伪造检测等研究,为自然语言处理、计算机视觉与人机交互领域开辟新的研究方向。
  • 通过真实世界数据支持开发面向文本到图像生成的人机交互友好型工具。

提出的方法

  • 通过网络爬取从官方Stable Diffusion Discord服务器获取用户生成的图像、提示词与超参数,使用DiscordChatExporter提取聊天记录与媒体文件。
  • 收集每张图像的元数据,包括随机种子、步数、分类器自由引导(CFG)尺度、采样器类型、图像分辨率、创建时间戳以及Discord用户哈希值。
  • 应用最先进的NSFW检测模型为每张图像和提示词计算安全评分,以实现对潜在有害内容的过滤与报告。
  • 通过哈希处理Discord用户名称并移除个人信息,对用户标识符进行匿名化处理,以保护隐私。
  • 设计灵活且分层的文件结构,按提示词、超参数与图像文件组织数据集,以实现高效访问与分析。
  • 以CC0 1.0许可发布数据集,并通过GitHub开源数据收集与处理流水线,以确保可复现性并支持社区扩展。

实验结果

研究问题

  • RQ1在Stable Diffusion中实际使用的文本到图像提示词中,最常见的句法与语义模式是什么?
  • RQ2哪些超参数配置(如CFG尺度、采样步数)最常与模型错误或图像质量下降相关联?
  • RQ3特定提示词风格在即使经过模型内置安全机制过滤后,是否仍与有害或NSFW内容的生成存在关联?
  • RQ4在Stable Diffusion中使用的提示词模式在多大程度上可推广至其他文本到图像模型(如DALL-E 2或Midjourney)?
  • RQ5该数据集能否用于训练或评估提示优化、图像生成对齐或深度伪造检测工具?

主要发现

  • DiffusionDB包含1400万张使用180万个独特提示词生成的图像,且包含完整的超参数元数据,包括随机种子、步数、CFG尺度、采样器类型与图像尺寸。
  • 数据集显示,某些提示词风格(如包含“trending on artstation”或“unreal engine”)与更高的图像细节与质量显著相关。
  • 特定超参数组合(尤其是高CFG尺度与低步数)频繁与模型伪影及生成错误相关联。
  • 尽管存在内置NSFW过滤机制,数据集中仍包含1400万张图像中部分未被识别为有害内容,表明自动化安全机制可能存在漏洞。
  • 发现了提示词被用于生成虚假信息或非自愿内容的证据,凸显了在缺乏监管的文本到图像生成中的潜在风险。
  • 该数据集以CC0 1.0许可公开发布,允许无限制地用于研究与开发,支持自由使用、分享与修改。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。