Skip to main content
QUICK REVIEW

[论文解读] Evaluating a Synthetic Image Dataset Generated with Stable Diffusion

Andreas Stöckl|arXiv (Cornell University)|Nov 3, 2022
Image Retrieval and Classification Techniques被引用 9
一句话总结

本文评估了使用 Stable Diffusion 生成的合成图像数据集,利用 WordNet 概念作为文本提示,以评估图像质量和分类性能。通过使用视觉 Transformer 模型,研究发现 73% 的概念至少产生了一张被正确分类的图像,但高度特定的动物类别性能显著下降,凸显了该模型在广泛能力与细粒度视觉准确性方面的优势与局限。

ABSTRACT

We generate synthetic images with the "Stable Diffusion" image generation model using the Wordnet taxonomy and the definitions of concepts it contains. This synthetic image database can be used as training data for data augmentation in machine learning applications, and it is used to investigate the capabilities of the Stable Diffusion model. Analyses show that Stable Diffusion can produce correct images for a large number of concepts, but also a large variety of different representations. The results show differences depending on the test concepts considered and problems with very specific concepts. These evaluations were performed using a vision transformer model for image classification.

研究动机与目标

  • 评估使用系统化、基于分类法的方法生成的 Stable Diffusion 合成图像的质量和表征保真度。
  • 评估预训练视觉 Transformer 模型对 WordNet 定义概念衍生的合成图像的分类能力。
  • 识别在不同语义类别中分类性能的模式,特别是关于具体程度和视觉复杂性的差异。
  • 探索此类合成数据集在监督学习中的数据增强和模型评估中的潜力。
  • 通过识别在生成不适当或错误内容方面的失败情况,调查 Stable Diffusion 内容过滤器的可靠性。

提出的方法

  • 使用 Stable Diffusion 1.4 模型,基于 WordNet 概念定义生成合成图像,作为文本提示。
  • 利用 WordNet 的分层结构组织数据集,以实现在不同语义类别中的系统性评估。
  • 采用预训练视觉 Transformer (vit_h_14) 进行图像分类,使用真实 ImageNet 数据作为 top-1 和 top-5 准确率的基准。
  • 应用主成分分析(PCA)和 t-SNE 进行降维,通过 FastText 词嵌入在二维空间中可视化正确分类图像的语义聚类。
  • 使用 FastText 嵌入(300D)处理多词类别名称,通过累加单个词向量以确保对罕见或复合术语的覆盖。
  • 按 WordNet 超类和子类评估分类性能,重点关注准确率、图像多样性及失败案例。

实验结果

研究问题

  • RQ1Stable Diffusion 在多大程度上能生成被视觉 Transformer 正确分类的图像,覆盖广泛的 WordNet 概念?
  • RQ2分类准确率在不同语义类别之间如何变化,特别是在一般概念与高度特定概念之间?
  • RQ3语义层次结构和概念具体程度在模型生成可识别图像的能力中起什么作用?
  • RQ4每个概念的图像多样性如何影响分类性能,这对数据增强意味着什么?
  • RQ5Stable Diffusion 的内容过滤器在多大程度上会失效,特别是在生成错误或不适当内容方面?

主要发现

  • 在测试的 1180 个概念中,73%(861 个)产生了至少一张被视觉 Transformer 正确分类的图像,表明其具有广泛的表征能力。
  • 在 'Building' 超类中,'Restaurant'、'Monastery' 和 'Greenhouse' 的图像全部被正确分类,识别率达到 100%。
  • 'Animal' 超类表现低于平均水平,162 个动物类别未产生任何正确分类的图像,主要由于概念的具体程度高和层级深度大。
  • 如 'black footed ferret' 和 'leafhopper' 等特定动物常被错误分类或生成视觉上不准确的图像,表明在细粒度视觉生成方面存在局限。
  • 使用 t-SNE 和 PCA 的可视化显示,正确分类的图像在嵌入空间中形成了有意义的聚类,但许多小红点(低准确率类别)零散分布,尤其集中在 'Animal' 组。
  • 研究发现,尽管有提示约束,Stable Diffusion 的内容过滤仍存在失败,部分生成图像包含不适当或错误的内容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。