[论文解读] Learning From Multiple Experts: Self-paced Knowledge Distillation for Long-tailed Classification
该论文提出了一种自 paced 知识蒸馏框架——多专家学习(LFME),通过在较少失衡、基数相邻的数据子集上训练多个专家模型,并自适应地将它们的知识迁移至统一的学生模型,从而提升长尾分类性能。该方法采用两种自适应调度机制——自 paced 专家选择与课程实例选择,在基准数据集上实现了最先进性能,相较于先前方法,平均准确率最高提升 3.2%。
In real-world scenarios, data tends to exhibit a long-tailed distribution, which increases the difficulty of training deep networks. In this paper, we propose a novel self-paced knowledge distillation framework, termed Learning From Multiple Experts (LFME). Our method is inspired by the observation that networks trained on less imbalanced subsets of the distribution often yield better performances than their jointly-trained counterparts. We refer to these models as 'Experts', and the proposed LFME framework aggregates the knowledge from multiple 'Experts' to learn a unified student model. Specifically, the proposed framework involves two levels of adaptive learning schedules: Self-paced Expert Selection and Curriculum Instance Selection, so that the knowledge is adaptively transferred to the 'Student'. We conduct extensive experiments and demonstrate that our method is able to achieve superior performances compared to state-of-the-art methods. We also show that our method can be easily plugged into state-of-the-art long-tailed classification algorithms for further improvements.
研究动机与目标
- 为解决真实视觉任务中长尾数据分布带来的挑战,其中少数类样本不足。
- 通过利用在较少失衡、基数相邻数据子集上训练的多个专家模型的知识,提升模型泛化能力。
- 设计一种双层次自适应学习方案,实现专家到统一学生模型的有效且渐进式知识迁移。
- 在长尾分类基准上实现最先进性能,同时与现有最先进方法兼容。
提出的方法
- 该方法引入四种度量来量化数据分布的‘长尾性’,从而识别出较少失衡、基数相邻的子集。
- 专家模型在这些子集上进行训练,每个专家专注于具有相似样本数量的类别组(例如,多 shot、中 shot、少 shot 类别)。
- 自 paced 专家选择动态控制每个专家模型在蒸馏过程中的贡献,使学生模型能够逐步吸收知识,并最终超越单个专家。
- 课程实例选择根据模型置信度,将训练样本从简单到困难进行排序,提升训练稳定性和性能。
- 知识蒸馏通过学生与专家预测之间的交叉熵损失实现,同时通过自 paced 调度器实现自适应加权。
- 该框架即插即用,可与现有长尾学习方法(如类别级采样、知识蒸馏和损失重加权)兼容。
实验结果
研究问题
- RQ1在较少失衡、基数相邻的数据子集上进行训练,是否能获得比在完整长尾分布上联合训练更优的专家模型?
- RQ2如何自适应地将多个专家模型的知识迁移至统一的学生模型,使其超越单个专家?
- RQ3在模型(专家)和实例两个层面进行学习调度,对长尾分类性能有何影响?
- RQ4所提出的框架能否有效结合现有最先进长尾学习方法,实现进一步性能提升?
主要发现
- 所提出的 LFME 框架在三个基准长尾分类数据集上实现了最先进性能,在 iNaturalist-2012 数据集上平均准确率达到 37.2%,优于先前方法。
- 自 paced 专家选择(SpES)分别在实例级和类别级采样基线上使学生模型性能提升 0.4% 和 1.3%,通过消除专家的性能上限。
- 课程实例选择(CurIS)弥补了知识蒸馏导致的少量样本类别准确率轻微下降,使其提升 1.0%。
- 类别级采样、知识蒸馏、SpES 和 CurIS 的组合在 iNaturalist-2012 上实现了 47.1% 的平均准确率,相比仅使用类别级采样和知识蒸馏的基线,性能提升 3.2%。
- 该方法对超参数 α 具有鲁棒性,仅当 α 达到 1.0 时性能才出现下降,表明自适应调度的重要性。
- T-SNE 可视化结果表明,LFME 生成了更紧凑、更结构化的特征流形,表明其在无需显式重加权的情况下提升了判别能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。