[论文解读] Flexible Dataset Distillation: Learn Labels Instead of Images
本文提出标签蒸馏(label distillation)——一种新颖的图像数据集蒸馏方法,该方法为真实图像生成合成标签,而非生成合成图像,从而实现更灵活、可迁移性更强且性能更高的蒸馏数据集。通过采用基于一阶凸优化的元学习方法,该方法在保持与现成优化器和多种神经网络架构兼容的同时,实现了更优的性能,并支持跨数据集学习,例如在英语字母上进行训练以识别日文字符。
We study the problem of dataset distillation - creating a small set of synthetic examples capable of training a good model. In particular, we study the problem of label distillation - creating synthetic labels for a small set of real images, and show it to be more effective than the prior image-based approach to dataset distillation. Methodologically, we introduce a more robust and flexible meta-learning algorithm for distillation, as well as an effective first-order strategy based on convex optimization layers. Distilling labels with our new algorithm leads to improved results over prior image-based distillation. More importantly, it leads to clear improvements in flexibility of the distilled dataset in terms of compatibility with off-the-shelf optimizers and diverse neural architectures. Interestingly, label distillation can also be applied across datasets, for example enabling learning Japanese character recognition by training only on synthetically labeled English letters.
研究动机与目标
- 解决先前基于图像的数据集蒸馏方法在特定优化器、网络架构和训练流程上受限的僵化问题。
- 提升蒸馏数据集在不同神经网络架构和优化算法之间的泛化能力与可迁移性。
- 实现新型跨数据集知识迁移,例如仅通过合成标签的英语字母实现对日文字符的识别学习。
- 开发一种更高效、可扩展的蒸馏算法,避免高阶梯度并降低优化方差。
- 构建一种通用的蒸馏数据集,可与标准训练流程无缝集成,推动数据集蒸馏的实际部署。
提出的方法
- 提出标签蒸馏(LD),即为真实图像生成合成标签,而非合成完整图像,从而减少参数空间并利用自然图像的统计特性。
- 引入一种基于凸优化层的一阶元学习算法,避免昂贵的二阶梯度计算,提升训练稳定性和效率。
- 采用伪梯度方法以降低元梯度方差,从而在蒸馏过程中实现更稳定、更高效的优化。
- 在收敛时采用多步训练与重置策略,以增强蒸馏标签的泛化能力和可迁移性。
- 使用标准优化器(如Adam)在蒸馏标签上训练基础模型,证明其与现成训练设置的兼容性。
- 将该方法应用于同数据集与跨数据集场景,包括在英语字母上进行训练以分类日文字符。
实验结果
研究问题
- RQ1在数据集蒸馏中,为真实图像生成的合成标签是否能优于合成图像,同时提升灵活性与可迁移性?
- RQ2基于一阶凸优化的元学习方法是否能在标签蒸馏中实现比二阶方法更优的性能与稳定性?
- RQ3在单一数据集(如英语字母)上训练的蒸馏标签,能在多大程度上有效支持在不相交的目标数据集(如日文字符)上的学习?
- RQ4在测试准确率以及与标准优化器和网络架构的兼容性方面,标签蒸馏与先前的基于图像的蒸馏方法相比表现如何?
- RQ5蒸馏标签是否可有效复用于不同神经网络架构而无需重新训练蒸馏过程?
主要发现
- 标签蒸馏在测试准确率上优于先前基于图像的蒸馏方法,在MNIST和EMNIST数据集上均验证了性能提升。
- 蒸馏标签与现成优化器(如Adam)兼容,而先前方法需依赖自定义学习率调度和访问序列。
- 蒸馏标签的可迁移性显著提高:在AlexNet上训练的模型在LeNet和ResNet-18上泛化良好,优于基线方法。
- 跨数据集标签蒸馏实现了仅通过合成标签的英语字母即可学习日文字符识别,证明了跨领域知识迁移的可行性。
- 与二阶方法相比,伪梯度方法将元梯度方差降低了最多50%,从而实现更稳定的训练和更优的收敛性。
- 在相同任务下,一阶方法实现了84%的标签恢复准确率,而二阶变体仅为63%,表明其具备更强的标签学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。