Skip to main content
QUICK REVIEW

[论文解读] Self-informed neural network structure learning

David Warde-Farley, Andrew Rabinovich|arXiv (Cornell University)|Dec 20, 2014
Domain Adaptation and Few-Shot Learning参考文献 6被引用 13
一句话总结

本文提出一种方法,通过添加专门针对视觉上相似类别簇的辅助全连接层,提升预训练深度神经网络在大规模多标签视觉识别任务上的性能。利用网络自身预测结果引导标签相似性的谱聚类,该方法在乘加操作增加不足3%的情况下,将平均平均精度(mAP)提升了2.61个百分点。

ABSTRACT

We study the problem of large scale, multi-label visual recognition with a large number of possible classes. We propose a method for augmenting a trained neural network classifier with auxiliary capacity in a manner designed to significantly improve upon an already well-performing model, while minimally impacting its computational footprint. Using the predictions of the network itself as a descriptor for assessing visual similarity, we define a partitioning of the label space into groups of visually similar entities. We then augment the network with auxilliary hidden layer pathways with connectivity only to these groups of label units. We report a significant improvement in mean average precision on a large-scale object recognition task with the augmented model, while increasing the number of multiply-adds by less than 3%.

研究动机与目标

  • 在不显著增加推理成本的前提下,提升预训练深度神经网络在大规模多标签视觉识别任务上的性能。
  • 解决通用型网络难以区分细粒度和长尾类别所带来的挑战。
  • 开发一种智能扩展网络容量的方法,利用模型自身预测结果识别语义相似的标签组。
  • 通过有针对性的、结构感知的容量扩展,在最小化计算开销的同时最大化性能提升。

提出的方法

  • 该方法利用在验证集上运行训练好的网络所得到的预测结果,计算混淆矩阵,以捕捉类别间的相似性。
  • 对混淆矩阵应用谱聚类,将标签空间划分为视觉上相似的类别组。
  • 在原始网络并行添加辅助全连接网络堆栈,每个堆栈仅连接到特定的一组输出单元。
  • 冻结预训练网络的特征,仅在训练过程中微调新增的辅助头和最终分类器层。
  • 通过训练使网络能够利用辅助容量,提升每个标签簇内的判别能力,同时保持原始模型的泛化能力。
  • 该方法避免重新训练整个网络,而是专注于有效学习新路径的使用方式。

实验结果

研究问题

  • RQ1能否通过添加专门设计的、低开销的路径来改进预训练神经网络,使其聚焦于视觉上相似的类别子集?
  • RQ2使用模型自身预测结果定义标签簇,是否能带来比随机或启发式标签分组更好的性能?
  • RQ3此类有针对性的容量增强是否能在计算成本极低的前提下,提升长尾和细粒度类别上的平均平均精度?
  • RQ4性能增益在不同聚类策略和网络配置下是否具有鲁棒性?

主要发现

  • 所提方法在JFT-18B数据集上实现了39.41%的平均平均精度(mAP),较基线模型的36.80%提升了2.61个百分点。
  • 该提升仅带来2.6%的乘加操作增加,从1.52B上升至1.56B。
  • 该方法显著优于随机标签划分基线,后者在相同容量约束下仅达到32.97%的mAP。
  • 当采用基于共检测的聚类方法并使用13个头时,该方法达到38.07%的mAP,仍优于随机基线(32.13%)和基线模型。
  • 结果表明,基于模型预测的自洽标签聚类能比随机或基于元数据的分组实现更有效的容量利用。
  • 该方法具有通用性,可推广至计算机视觉以外的其他领域,因其仅依赖模型预测结果,而不依赖输入模态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。