[论文解读] Training on Thin Air: Improve Image Classification with Generated Data
本文提出Diffusion Inversion方法,利用Stable Diffusion通过将真实图像反演至潜在空间并基于噪声潜在向量进行条件生成,从而生成高质量、多样化的图像分类训练数据。该方法实现2–3倍样本复杂度提升与6.5倍更快采样速度,优于基线方法,在包括存在显著分布偏移的各类数据集上,表现超越基于提示的生成与KNN检索。
Acquiring high-quality data for training discriminative models is a crucial yet challenging aspect of building effective predictive systems. In this paper, we present Diffusion Inversion, a simple yet effective method that leverages the pre-trained generative model, Stable Diffusion, to generate diverse, high-quality training data for image classification. Our approach captures the original data distribution and ensures data coverage by inverting images to the latent space of Stable Diffusion, and generates diverse novel training images by conditioning the generative model on noisy versions of these vectors. We identify three key components that allow our generated images to successfully supplant the original dataset, leading to a 2-3x enhancement in sample complexity and a 6.5x decrease in sampling time. Moreover, our approach consistently outperforms generic prompt-based steering methods and KNN retrieval baseline across a wide range of datasets. Additionally, we demonstrate the compatibility of our approach with widely-used data augmentation techniques, as well as the reliability of the generated data in supporting various neural architectures and enhancing few-shot learning.
研究动机与目标
- 为解决在数据稀缺或专业领域中获取高质量、多样化训练数据的挑战。
- 通过确保生成样本的分布保真度与数据覆盖度,弥合真实数据与合成数据之间的性能差距。
- 开发一种可扩展、高效的图像增强方法,兼容标准深度学习流水线与神经网络架构。
- 证明通过潜在空间反演生成的合成数据,若结合适当的条件控制与采样策略,可在模型性能上超越真实数据。
提出的方法
- 利用文本编码器的输出将真实训练图像反演至Stable Diffusion的潜在空间,以保留语义与分布特性。
- 基于反演潜在向量的噪声版本对生成模型进行条件控制,生成语义一致、新颖且多样的训练图像。
- 学习条件向量以直接生成低分辨率(128×128)图像,相比高分辨率生成后下采样,采样时间减少6.5倍。
- 通过在两个反演嵌入之间进行潜在插值,并调节插值强度(α),生成中间形态、多样化的图像变体。
- 在生成过程中对潜在向量施加高斯噪声扰动以增强多样性,最优噪声强度λ=0.2可实现更长采样周期。
- 评估并调整超参数,如推理步数(100)、噪声强度与插值强度,以在质量、多样性与性能之间取得平衡。
实验结果
研究问题
- RQ1预训练生成模型如Stable Diffusion能否用于生成在图像分类任务中性能匹配甚至超越真实数据的合成数据?
- RQ2哪些关键组件对于使合成数据在样本复杂度与泛化能力方面优于真实数据至关重要?
- RQ3与基于提示或KNN的生成方法相比,结合噪声条件的潜在空间反演在分布保真度与模型准确率方面表现如何?
- RQ4在存在数据分布偏移的专业领域中,生成数据在少样本学习与泛化能力提升方面能达到何种程度?
主要发现
- Diffusion Inversion实现2–3倍样本复杂度提升,即使用生成数据训练的模型在更少样本下即可达到更高准确率,优于使用真实数据训练的模型。
- 通过直接生成低分辨率图像而非高分辨率生成后下采样,该方法将采样时间减少6.5倍,显著提升效率。
- 生成数据在所有评估数据集上均优于通用的基于提示的引导生成与从LAION-5B检索的KNN方法,包括存在大分布偏移的医学影像数据集。
- 最优性能在噪声强度λ=0.2与插值强度α≈0.1时达成,FID、精确率、召回率与覆盖度等指标综合衡量下,质量与多样性达到最佳平衡。
- 在语义兼容的嵌入之间进行潜在插值可在所有α值下生成真实且新颖的图像,但当α过高时,因语义不一致导致性能急剧下降。
- 该方法与标准数据增强技术兼容,并在多种神经网络架构(包括ResNet18)上显著提升少样本学习性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。