[论文解读] Long-Tailed Visual Recognition via Self-Heterogeneous Integration with Knowledge Excavation
本文提出 SHIKE,一种用于长尾视觉识别的新颖混合专家(MoE)框架,通过整合深度知识融合(DKF)与动态知识迁移(DKT),提升头部、中等和尾部类别之间的表征学习能力。通过融合不同网络深度的特征,并在蒸馏过程中抑制最难的负样本,SHIKE 在 CIFAR100-LT 上达到 56.3% 的最先进准确率,在 ImageNet-LT 上达到 60.3%,在 iNaturalist 2018 上达到 75.4%,在 Places-LT 上达到 41.9%。
Deep neural networks have made huge progress in the last few decades. However, as the real-world data often exhibits a long-tailed distribution, vanilla deep models tend to be heavily biased toward the majority classes. To address this problem, state-of-the-art methods usually adopt a mixture of experts (MoE) to focus on different parts of the long-tailed distribution. Experts in these methods are with the same model depth, which neglects the fact that different classes may have different preferences to be fit by models with different depths. To this end, we propose a novel MoE-based method called Self-Heterogeneous Integration with Knowledge Excavation (SHIKE). We first propose Depth-wise Knowledge Fusion (DKF) to fuse features between different shallow parts and the deep part in one network for each expert, which makes experts more diverse in terms of representation. Based on DKF, we further propose Dynamic Knowledge Transfer (DKT) to reduce the influence of the hardest negative class that has a non-negligible impact on the tail classes in our MoE framework. As a result, the classification accuracy of long-tailed data can be significantly improved, especially for the tail classes. SHIKE achieves the state-of-the-art performance of 56.3%, 60.3%, 75.4%, and 41.9% on CIFAR100-LT (IF100), ImageNet-LT, iNaturalist 2018, and Places-LT, respectively.
研究动机与目标
- 解决深度神经网络在长尾数据分布下对头部类别存在的偏差问题。
- 克服现有 MoE 方法中使用相同深度的同质专家所带来的局限性,此类方法无法捕捉类别特异的深度偏好。
- 通过自异构集成方式,整合浅层与深层网络部分的知识,提升尾部类别的表征学习能力。
- 在 MoE 框架中通过知识蒸馏减少最难负样本的负面影响。
提出的方法
- 提出深度知识融合(DKF),该组件将网络浅层与深层部分的中间特征融合为每个专家的高层特征,增强特征多样性与表征能力。
- 引入动态知识迁移(DKT),通过识别并重新加权来自不同专家的高值非目标 logits,形成统一的“总教师”以蒸馏非目标预测结果。
- 采用目标与非目标知识联合蒸馏:前者通过标准蒸馏损失实现,后者通过 DKT 抑制最难负类的影响。
- 使用平衡交叉熵损失(BSCE)训练 MoE 模型,并联合优化 DKF 与 DKT 组件,以提升在长尾类别上的泛化能力。
- 设计异质专家架构,其中每个专家使用来自不同深度层级(浅层、中层、深层)的特征,使专家能够针对长尾分布的不同部分实现专业化。
- 利用自蒸馏机制,将浅层网络分支的知识迁移至深层专家,实现无论样本数量多少均具备自适应学习能力。
实验结果
研究问题
- RQ1将不同网络深度的特征进行融合,是否能提升长尾视觉识别中的表征多样性与性能?
- RQ2深度网络对特定类别的偏好是否随深度变化,这种特性能否被利用以改善尾部类别泛化?
- RQ3来自多样化专家的动态知识迁移是否能有效抑制蒸馏过程中最难负样本的影响?
- RQ4MoE 框架中专家的数量与异质性如何影响长尾学习的性能?
- RQ5通过浅层与深层特征的自异构知识集成,是否能实现优于标准 MoE 中同质专家的泛化性能?
主要发现
- SHIKE 在 CIFAR100-LT(IF100)上实现 56.3% 的准确率,达到最先进性能,显著优于基线 MoE 模型。
- 在 ImageNet-LT 上,SHIKE 达到 60.3% 的准确率,展现出在大规模长尾数据上的强大泛化能力。
- 在 iNaturalist 2018 上,SHIKE 实现 75.4% 的 top-1 准确率,表明其在细粒度、长尾基准上的鲁棒性。
- 在 Places-LT 上,SHIKE 达到 41.9% 的准确率,证明其在极端类别不平衡的场景识别任务中的有效性。
- 消融实验表明,DKF 是基础性组件,当其他组件被移除时,其仍贡献 0.59% 的准确率增益。
- 在 CIFAR100-LT 上,DKT 将高概率最难负样本数量减少 30%,验证了其在蒸馏过程中抑制负面干扰的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。