Skip to main content
QUICK REVIEW

[论文解读] Is Synthetic Data From Diffusion Models Ready for Knowledge Distillation?

Zheng Li, Yuxuan Li|arXiv (Cornell University)|May 22, 2023
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文研究在缺乏真实训练数据的情况下,使用最先进扩散模型生成的合成图像进行知识蒸馏。提出一种简单、兼容黑箱的方法,利用公开的扩散模型生成代理数据集,在多个基准测试中实现最先进性能——令人惊讶的是,低保真度图像和较弱的教师模型反而表现更优,这是由于减少了领域偏移并改善了特征迁移。

ABSTRACT

Diffusion models have recently achieved astonishing performance in generating high-fidelity photo-realistic images. Given their huge success, it is still unclear whether synthetic images are applicable for knowledge distillation when real images are unavailable. In this paper, we extensively study whether and how synthetic images produced from state-of-the-art diffusion models can be used for knowledge distillation without access to real images, and obtain three key conclusions: (1) synthetic data from diffusion models can easily lead to state-of-the-art performance among existing synthesis-based distillation methods, (2) low-fidelity synthetic images are better teaching materials, and (3) relatively weak classifiers are better teachers. Code is available at https://github.com/zhengli97/DM-KD.

研究动机与目标

  • 探究由最先进扩散模型生成的合成图像是否能在无真实数据的情况下有效替代知识蒸馏中的真实数据。
  • 评估在因隐私或安全限制无法获取真实数据时,仅使用合成数据进行蒸馏的性能表现。
  • 在无数据蒸馏设置下,识别合成数据生成与教师-学生模型架构选择的最佳配置。
  • 理解图像保真度与教师模型容量对使用合成数据进行蒸馏性能的影响。

提出的方法

  • 利用公开可用的预训练条件扩散模型(如 Stable Diffusion、DiT)生成合成图像作为知识蒸馏的代理训练数据。
  • 使用预训练的教师模型为合成图像生成软标签,再通过标准蒸馏损失训练学生模型。
  • 在蒸馏过程中应用温度缩放,以平滑概率分布并提升知识迁移效果。
  • 将扩散模型的类别标签作为硬标签,与软标签联合训练,以评估其影响。
  • 系统性地调整扩散模型的超参数,如引导尺度(s)和采样步数(T),以评估其对蒸馏性能的影响。
  • 对温度、标签类型(软标签 vs. 硬标签)以及教师-学生模型容量差距进行消融研究,以分离关键影响因素。

实验结果

研究问题

  • RQ1由最先进扩散模型生成的合成图像是否能在无数据设置下有效替代真实数据进行知识蒸馏?
  • RQ2合成数据中更高的图像保真度是否带来更好的蒸馏性能,还是较低保真度更为有益?
  • RQ3在使用合成数据时,更强的教师模型是否始终更优?较弱的教师模型是否可能表现更优?
  • RQ4扩散模型中的超参数(如引导尺度和采样步数)如何影响合成数据的质量与蒸馏实用性?
  • RQ5与仅使用软标签相比,使用扩散模型类别标签作为硬标签在多大程度上改善或降低蒸馏性能?

主要发现

  • 在 ImageNet-1K、ImageNet-100、CIFAR-100 和 Flowers-102 上,使用扩散模型生成的合成数据在无数据知识蒸馏中实现了最先进性能,即使合成数据集与目标数据集之间无类别重叠。
  • 保真度较低的合成图像——通过较小的引导尺度(s)和较少的采样步数(T)生成——相比保真度更高的图像,能带来更好的学生模型性能,尽管后者在 ImageReward 指标上得分更高。
  • 当在合成数据上训练时,使用相对较弱的教师模型(如 ResNet18)优于使用更强的模型(如 ResNet50),在 ImageNet 上训练 ResNet34 时观察到 3% 的准确率提升。
  • 与仅使用软标签相比,将扩散模型类别标签作为硬标签进行联合训练会降低性能,表明合成数据与真实数据之间存在领域偏移。
  • 蒸馏过程中的最优温度超参数为 τ = 10,该设置在各项实验中均取得最佳性能。
  • 随着用于蒸馏的合成图像数量增加,学生模型的性能持续提升,表明所提方法具有良好的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。