[논문 리뷰] DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models
이 논문은 Stable Diffusion에서 유저가 생성한 1400만 건의 텍스트-이미지 생성 결과를 담은 6.5TB 크기의 DiffusionDB를 소개한다. 이 데이터셋에는 고유한 프롬프트 180만 개와 완전한 초모수 메타데이터가 포함되어 있으며, 프롬프트 엔지니어링, 모델 동작 분석, 악용 패턴 연구를 체계적으로 가능하게 한다. 분석을 통해 초모수에 기인한 오류와 가짜 정보 생성 증거를 발견했으며, 연구 목적을 위해 CC0 라이선스 하에 공개된다.
With recent advancements in diffusion models, users can generate high-quality images by writing text prompts in natural language. However, generating images with desired details requires proper prompts, and it is often unclear how a model reacts to different prompts or what the best prompts are. To help researchers tackle these critical challenges, we introduce DiffusionDB, the first large-scale text-to-image prompt dataset totaling 6.5TB, containing 14 million images generated by Stable Diffusion, 1.8 million unique prompts, and hyperparameters specified by real users. We analyze the syntactic and semantic characteristics of prompts. We pinpoint specific hyperparameter values and prompt styles that can lead to model errors and present evidence of potentially harmful model usage, such as the generation of misinformation. The unprecedented scale and diversity of this human-actuated dataset provide exciting research opportunities in understanding the interplay between prompts and generative models, detecting deepfakes, and designing human-AI interaction tools to help users more easily use these models. DiffusionDB is publicly available at: https://poloclub.github.io/diffusiondb.
연구 동기 및 목표
- 텍스트-이미지 확산 모델에서 효과적인 프롬프트 엔지니어링을 해결하기 위해, 사용자가 원하는 출력물을 생성하기 어려운 문제를 다루며, 시행착오와 체계적 지침의 부족으로 인한 곤경을 해결하고자 한다.
- 사용자 실재 데이터를 대규모로 확보하여, 프롬프트, 초모수, 이미지 출력 간의 상호작용을 분석하고 모델 행동에 대한 경험적 연구를 지원하고자 한다.
- 모델 오류나 해로운 출력물(예: 가짜 정보 또는 비공개 콘텐츠 포함)을 유발하는 프롬프트 패턴과 초모수 설정을 규명하고자 한다.
- 프롬프트 최적화, 모델 해석 가능성, 딥페이크 탐지 분야의 새로운 연구 기회를 열어, 자연어 처리, 컴퓨터 비전, 인터페이스 설계 분야의 연구를 지원하고자 한다.
- 실제 세계 데이터를 기반으로 인간-AI 상호작용을 위한 사용자 우아한 도구 개발을 지원하고자 한다.
제안 방법
- 공식 Stable Diffusion 디스코드 서버에서 사용자가 생성한 이미지, 프롬프트, 초모수를 웹 스크래핑하여, DiscordChatExporter를 활용해 채팅 로그와 미디어를 추출한다.
- 각 이미지에 대해 시드, 스텝 수, 분류기 없는 지시(CFG) 스케일, 샘플러 유형, 이미지 해상도, 생성 타임스탬프, 디스코드 사용자 해시 등의 메타데이터를 수집한다.
- 최신 기술의 NSFW 탐지 모델을 적용하여 각 이미지와 프롬프트의 안전성 점수를 계산하고, 해로운 콘텐츠의 필터링 및 보고를 가능하게 한다.
- 사용자 식별자를 해시화한 디스코드 사용자명과 개인정보를 제거하여 익명화하여 개인정보 보호를 확보한다.
- 효율적인 액세스와 분석을 위해, 프롬프트, 초모수, 이미지 파일을 기반으로 한 유연하고 계층적인 파일 구조를 설계한다.
- CC0 1.0 라이선스 하에 데이터셋을 공개하고, GitHub를 통해 데이터 수집 및 처리 파이프라인을 오픈소스화하여 재현성과 커뮤니티 기여를 지원한다.
실험 결과
연구 질문
- RQ1Stable Diffusion에서 실제 사용자가 사용하는 텍스트-이미지 프롬프트의 가장 일반적인 문법적 및 의미적 패턴은 무엇인가?
- RQ2CFG 스케일, 샘플링 스텝 수 등 특정 초모수 설정이 모델 오류나 이미지 품질 저하와 어떤 연관이 있는가?
- RQ3모델 내장된 안전 메커니즘으로도 필터링되지 않은 채로, 특정 프롬프트 스타일이 해로운 콘텐츠 또는 NSFW 콘텐츠 생성과 어떤 관련이 있는가?
- RQ4Stable Diffusion에서 사용된 프롬프트 패턴이 DALL-E 2나 Midjourney와 같은 다른 텍스트-이미지 모델로 일반화되는 정도는 어느 정도인가?
- RQ5이 데이터셋을 활용해 프롬프트 최적화, 이미지 생성 일치성, 딥페이크 탐지 도구의 학습 또는 평가가 가능한가?
주요 결과
- DiffusionDB는 1400만 건의 이미지와 180만 개의 고유한 프롬프트를 포함하며, 시드, 스텝 수, CFG 스케일, 샘플러, 이미지 크기 등 완전한 초모수 메타데이터를 제공한다.
- 이 데이터셋은 'artstation에서 인기 있는 트렌드' 또는 '언리얼 엔진'을 포함하는 프롬프트 스타일이 더 높은 이미지 세부 정보와 품질과 강하게 연관되어 있음을 드러냈다.
- 특정 초모수 조합, 특히 높은 CFG 스케일과 낮은 스텝 수 조합이 모델 아티팩트 및 생성 오류와 자주 연관되어 있었다.
- 내장된 NSFW 필터에도 불구하고, 1400만 건의 이미지 중 일부는 해로운 것으로 간주되지 않았으며, 이는 자동화된 안전 메커니즘의 잠재적 한계를 시사한다.
- 가짜 정보나 비공개 콘텐츠 생성을 위한 프롬프트 사용 증거가 발견되어, 규제되지 않은 텍스트-이미지 생성의 위험성을 강조한다.
- 이 데이터셋은 CC0 1.0 라이선스 하에 공개되어 있어, 연구 및 개발 목적의 자유로운 사용, 공유, 변형이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.