[论文解读] Neural Networks Are More Productive Teachers Than Human Raters: Active Mixup for Data-Efficient Knowledge Distillation from a Blackbox Model
本文提出了一种数据与查询效率更高的知识蒸馏方法——Active Mixup,该方法利用混合增强的合成图像与主动学习,仅需极少的真实数据和教师模型查询次数,即可从黑箱教师模型中训练学生神经网络。该方法在性能上与或优于白箱蒸馏方法,证明了黑箱教师模型在标注语义上无意义的混合图像方面比人类标注者更具生产力,因其具备标注此类图像的能力。
We study how to train a student deep neural network for visual recognition by distilling knowledge from a blackbox teacher model in a data-efficient manner. Progress on this problem can significantly reduce the dependence on large-scale datasets for learning high-performing visual recognition models. There are two major challenges. One is that the number of queries into the teacher model should be minimized to save computational and/or financial costs. The other is that the number of images used for the knowledge distillation should be small; otherwise, it violates our expectation of reducing the dependence on large-scale datasets. To tackle these challenges, we propose an approach that blends mixup and active learning. The former effectively augments the few unlabeled images by a big pool of synthetic images sampled from the convex hull of the original images, and the latter actively chooses from the pool hard examples for the student neural network and query their labels from the teacher model. We validate our approach with extensive experiments.
研究动机与目标
- 为解决从黑箱教师模型中蒸馏知识时,使用极少标注数据且查询成本低的挑战。
- 减少对大规模数据集的依赖,以训练高性能的视觉识别模型。
- 在教师模型不可访问或查询成本高昂的情况下,提升知识蒸馏中的数据效率与查询效率。
- 验证即使语义上无意义,混合增强的合成图像仍可有效替代真实数据用于知识蒸馏。
- 证明黑箱教师模型在教学学生网络方面优于人类标注者,因其能够标注合成的、模糊的图像。
提出的方法
- 使用混合增强方法生成大量合成图像,通过不同系数对未标注图像进行凸组合。
- 利用主动学习选择不确定性最高的混合图像——通过丢弃来自同一对原始图像的重复样本,优先保证多样性——基于学生网络的预测结果。
- 仅对选定的高不确定性混合图像查询黑箱教师模型,将其输出作为伪标签用于学生网络的训练。
- 通过迭代方式使用新查询的标签重新训练学生网络,逐步优化不确定性估计并提升性能。
- 在式(3)中引入多样性约束(C₂),通过确保仅从每对原始图像中选择不确定性最高的混合图像,避免冗余查询。
- 利用生成的伪标签混合图像数据训练学生模型,使其能够很好地泛化到真实测试图像。
实验结果
研究问题
- RQ1混合增强的合成图像能否有效作为从黑箱教师模型蒸馏知识的训练数据?
- RQ2将混合增强与主动学习结合,是否能显著减少对黑箱教师模型的查询次数,同时保持或提升学生模型的性能?
- RQ3在仅使用极少真实数据的情况下,从黑箱教师模型蒸馏知识的性能与从白箱教师模型相比如何?
- RQ4在目标领域(如CIFAR-10)上,能否有效利用分布外数据(如CIFAR-100图像)生成用于知识蒸馏的合成训练数据?
- RQ5在仅使用语义上无意义的混合图像进行训练的学生模型,是否仍能在真实测试图像上达到高准确率?
主要发现
- 在仅使用2,000张分布外图像与80,000张合成混合图像的情况下,Active Mixup在CIFAR-10上达到83.03%的top-1准确率,与使用80,000张真实图像的同域设置下87.89%的准确率相当。
- 当使用40,000张筛选后的合成图像与2,000张真实图像时,方法达到77.89%的准确率,表明在真实数据有限的情况下仍具备强大性能。
- 该方法优于基线主动学习与随机搜索,性能差距显著(如在CIFAR-10上83.03% vs. 71.39%),归因于混合图像选择中的多样性约束。
- 即使仅使用分布外数据(CIFAR-100)生成的合成图像,该方法在80,000张合成图像下仍达到83.03%的准确率,表明对数据分布偏移具有鲁棒性。
- 仅使用10,000张合成图像(无真实数据)训练的学生模型仍达到64.10%的准确率,证明混合增强在知识蒸馏中具有显著的数据增强价值。
- 黑箱教师模型比人类标注者更具生产力,因其能够标注语义上无意义的混合图像,而人类无法做到。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。