Skip to main content
QUICK REVIEW

[论文解读] Expanding Small-Scale Datasets with Guided Imagination

Yifan Zhang, Daquan Zhou|arXiv (Cornell University)|Nov 25, 2022
Generative Adversarial Networks and Image Synthesis被引用 11
一句话总结

该论文提出了一种引导想象框架(Guided Imagination Framework, GIF),通过使用像 Stable Diffusion 和 DALL-E2 这类预训练生成模型,生成逼真、类别一致且多样化的图像,从而扩展小规模数据集。通过在保留类别信息的同时增强潜在特征并促进样本多样性,GIF 在六个自然图像数据集上平均提升模型准确率 36.9%,在三个医学图像数据集上平均提升 13.5%,相比无引导生成方法表现更优。

ABSTRACT

The power of DNNs relies heavily on the quantity and quality of training data. However, collecting and annotating data on a large scale is often expensive and time-consuming. To address this issue, we explore a new task, termed dataset expansion, aimed at expanding a ready-to-use small dataset by automatically creating new labeled samples. To this end, we present a Guided Imagination Framework (GIF) that leverages cutting-edge generative models like DALL-E2 and Stable Diffusion (SD) to "imagine" and create informative new data from the input seed data. Specifically, GIF conducts data imagination by optimizing the latent features of the seed data in the semantically meaningful space of the prior model, resulting in the creation of photo-realistic images with new content. To guide the imagination towards creating informative samples for model training, we introduce two key criteria, i.e., class-maintained information boosting and sample diversity promotion. These criteria are verified to be essential for effective dataset expansion: GIF-SD obtains 13.5% higher model accuracy on natural image datasets than unguided expansion with SD. With these essential criteria, GIF successfully expands small datasets in various scenarios, boosting model accuracy by 36.9% on average over six natural image datasets and by 13.5% on average over three medical datasets. The source code is available at https://github.com/Vanint/DatasetExpansion.

研究动机与目标

  • 解决小规模数据集中因大规模标注成本高、耗时长而导致的数据稀缺问题。
  • 克服传统数据增强方法仅应用表面级变换、无法引入新内容的局限性。
  • 利用强大的预训练生成模型,创建信息丰富、逼真且多样化的合成样本,以提升模型泛化能力。
  • 确保生成的样本在语义上与原始类别保持一致,同时具备丰富的内容差异,以最大化训练收益。
  • 开发一种可扩展、安全且可控的框架,适用于包括医学影像在内的多样化领域。

提出的方法

  • 使用预训练生成模型(如 Stable Diffusion、DALL-E2、MAE)作为先验模型,将种子图像编码到潜在空间。
  • 在语义上有意义的空间中优化种子图像的潜在特征,以生成包含新内容的逼真图像。
  • 应用两个关键准则:类别保持的信息增强,以保留语义类别身份;样本多样性促进,以确保内容差异。
  • 利用 CLIP 实现零样本分类,将潜在特征映射到目标数据集的标签空间,确保合成样本的正确标注。
  • 通过 Google Cloud Vision API 实施安全检查,确保合成图像不包含成人、暴力或不当内容。
  • 在扩展后的数据集上训练深度神经网络,并在标准基准上评估性能,以验证有效性。

实验结果

研究问题

  • RQ1生成模型能否被有效引导,以生成在语义上与原始类别一致且内容多样性丰富的合成数据?
  • RQ2类别保持的信息增强与样本多样性促进如何提升生成数据的质量与下游训练的实用性?
  • RQ3引导想象在多大程度上优于无引导生成或传统数据增强方法,在小规模数据集上提升模型准确率?
  • RQ4所提出的框架能否在包括自然图像和医学影像在内的多样化领域中实现泛化,并保持一致的性能增益?
  • RQ5生成的合成数据的安全性如何?其是否可被可靠地应用于实际场景?

主要发现

  • GIF-SD 在自然图像数据集上的模型准确率相比无引导的 Stable Diffusion 生成高出 13.5%,证明了引导想象的有效性。
  • 在六个自然图像数据集上,GIF 平均提升模型准确率 36.9%,显著优于基线数据增强和无引导生成方法。
  • 在三个医学图像数据集上,该框架实现了平均 13.5% 的准确率增益,表明其在专业领域具有强大的泛化能力。
  • 通过 Google Cloud Vision API 进行的安全检查确认,96% 的生成图像被归类为‘极不可能’包含成人内容,超过 80% 被归类为‘极不可能’包含伪造或暴露内容,表明其安全性高,适合部署。
  • 可视化结果表明,GIF 生成的图像在语义上一致但内容多样——例如,猫的不同姿势、靠垫的不同纹理——证明了有效的信息扩展。
  • 利用 CLIP 实现零样本标签映射,确保了合成样本被正确分类并与目标数据集的语义对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。