[论文解读] DreamDA: Generative Data Augmentation with Diffusion Models
DreamDA 提出了一种新颖的生成式数据增强框架,通过扰动真实训练图像的逆扩散过程,并利用预训练的扩散模型生成多样化、高保真的图像,同时引入一种自训练范式(AMST)以生成可靠的伪标签。该方法在四个任务和五个数据集上均实现了稳定的准确率提升,在自然图像数据集上从零开始训练时,性能优于强基线模型超过 7.4%。
The acquisition of large-scale, high-quality data is a resource-intensive and time-consuming endeavor. Compared to conventional Data Augmentation (DA) techniques (e.g. cropping and rotation), exploiting prevailing diffusion models for data generation has received scant attention in classification tasks. Existing generative DA methods either inadequately bridge the domain gap between real-world and synthesized images, or inherently suffer from a lack of diversity. To solve these issues, this paper proposes a new classification-oriented framework DreamDA, which enables data synthesis and label generation by way of diffusion models. DreamDA generates diverse samples that adhere to the original data distribution by considering training images in the original data as seeds and perturbing their reverse diffusion process. In addition, since the labels of the generated data may not align with the labels of their corresponding seed images, we introduce a self-training paradigm for generating pseudo labels and training classifiers using the synthesized data. Extensive experiments across four tasks and five datasets demonstrate consistent improvements over strong baselines, revealing the efficacy of DreamDA in synthesizing high-quality and diverse images with accurate labels. Our code will be available at https://github.com/yunxiangfu2001/DreamDA.
研究动机与目标
- 为解决传统数据增强方法及现有生成式数据增强方法的局限性,这些方法通常难以弥合域间差距或缺乏多样性。
- 通过使用预训练的扩散模型,实现符合原始数据分布的高保真、多样化图像生成。
- 通过引入具备一致性与置信度约束的鲁棒自训练框架,解决生成数据中标签不一致的问题。
- 在多种视觉任务和数据集上,通过从零开始训练和微调两种设置,展示一致的性能提升。
提出的方法
- 通过在去噪每一步的 U-Net 编码器瓶颈层注入高斯噪声,扰动真实图像的逆扩散过程,从而实现多样化但逼真的图像生成。
- 使用真实训练图像作为种子引导扩散过程,确保生成样本保持在原始数据分布范围内。
- 提出非对称多头自训练(AMST),通过在多个分类器头之间施加一致性和置信度约束,生成可靠的伪标签。
- 应用一致性正则化损失,促使模型在标签不确定时,对相似数据点仍能产生一致的预测结果。
- 采用多头架构,共享特征表示并使用独立的分类头,以提升伪标签预测的鲁棒性与泛化能力。
- 在训练中结合真实数据与合成数据,实现端到端学习,且计算开销极低。
实验结果
研究问题
- RQ1通过在 U-Net 编码器瓶颈层注入噪声,扰动真实图像的逆扩散过程,能否生成符合原始数据分布、多样化且高保真的图像?
- RQ2在扩散过程中因语义漂移导致生成图像标签不一致的问题,能否通过有效的训练策略加以缓解?
- RQ3所提出的非对称多头自训练(AMST)框架是否在准确率与鲁棒性方面优于标准的伪标签方法?
- RQ4在扩散过程中实现图像保真度与多样性平衡的最佳扰动位置与噪声尺度为何?
- RQ5DreamDA 是否能在多种视觉任务与数据集上实现一致的性能提升,包括从零开始训练与微调两种场景?
主要发现
- 在自然图像数据集上从零开始训练时,DreamDA 相较于仅使用真实数据,可将模型准确率提升超过 41%。
- 在预训练模型上,DreamDA 相较于原始真实数据集,准确率提升 4%,展现出强大的迁移能力。
- 在自然图像数据集上从零开始训练时,DreamDA 相较于最强的基于扩散模型的基线方法,准确率提升 7.4%。
- 该方法在 FID 和 MMD 指标上达到最先进水平,表明其生成图像在分布相似性与多样性方面表现优异。
- 消融实验表明,潜在空间扰动与 AMST 均为关键组件,若分别移除,性能分别下降 5.6% 和 2.4%。
- 最优的扰动噪声尺度为 3,且在 U-Net 编码器瓶颈层注入噪声可获得最佳性能,优于其他位置的扰动。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。