Skip to main content
QUICK REVIEW

[论文解读] EnsembleNet: End-to-End Optimization of Multi-headed Models

Hanhan Li, Joe Yue-Hei Ng|arXiv (Cornell University)|May 24, 2019
Advanced Neural Network Applications参考文献 32被引用 14
一句话总结

EnsembleNet 提出了一种端到端的、单阶段训练框架,用于多头神经网络,通过协同蒸馏损失联合优化多个预测头,在模型规模相近的情况下实现了优于单模型的性能。该方法在 ImageNet、YouTube-8M 和 Kinetics 上均取得了最先进结果,且模型更小,无需人工干预。

ABSTRACT

Ensembling is a universally useful approach to boost the performance of machine learning models. However, individual models in an ensemble were traditionally trained independently in separate stages without information access about the overall ensemble. Many co-distillation approaches were proposed in order to treat model ensembling as first-class citizens. In this paper, we reveal a deeper connection between ensembling and distillation, and come up with a simpler yet more effective co-distillation architecture. On large-scale datasets including ImageNet, YouTube-8M, and Kinetics, we demonstrate a general procedure that can convert a single deep neural network to a multi-headed model that has not only a smaller size but also better performance. The model can be optimized end-to-end with our proposed co-distillation loss in a single stage without human intervention.

研究动机与目标

  • 为解决传统模型集成训练中效率低下且性能欠佳的问题,即各模型独立训练且互不知情。
  • 消除模型集成中对人工超参数调优和分阶段训练的需求。
  • 在保持或减少模型大小和 FLOPs 的前提下,实现优于单模型的准确率。
  • 通过一种更简单、更有效的协同蒸馏损失,统一集成与蒸馏,该损失无需对真实标签进行显式回归。

提出的方法

  • 提出一种具有共享基础特征和轻量预测头的多头神经网络架构。
  • 使用协同蒸馏损失,促使每个头预测集成输出,而非直接回归到真实标签。
  • 采用单阶段训练流程,通过协同蒸馏损失联合优化所有头和集成头。
  • 协同蒸馏损失定义为 $ \mathcal{L}_{\text{co-distill}} = \sum_{i=1}^{N} \ell(\mathbf{p}_{\text{ens}}, \mathbf{p}_i) $,其中 $ \mathbf{p}_{\text{ens}} $ 为集成预测,$ \mathbf{p}_i $ 为第 $ i $ 个头的预测。
  • 在推理时,集成输出 $ \mathbf{p}_{\text{ens}} $ 通过平均所有独立头预测得到。
  • 该方法避免对单个头进行显式真实标签监督,完全依赖来自集成的蒸馏知识。

实验结果

研究问题

  • RQ1是否可以实现多头模型的端到端单阶段训练,使其在与单模型相当的规模下表现更优?
  • RQ2协同蒸馏与传统集成或混合集成/蒸馏损失相比,在准确率和效率方面表现如何?
  • RQ3是否可以构建比单模型更小的模型集成,同时仍保持更高的准确率?
  • RQ4是否存在理论和实证上可利用的集成与知识蒸馏之间的联系,以实现更优训练?
  • RQ5所提出的方法是否可泛化至 ImageNet、YouTube-8M 和 Kinetics 等多样化大规模视觉基准?

主要发现

  • 在 ImageNet 上,EnsembleNet 使用 2 个分支且 $ \mu = 2 $ 时,top-1 准确率达到 88.36%,参数量为 226M,FLOPs 为 410M,优于同等规模的单模型。
  • 在 YouTube-8M 上,协同蒸馏损失在 $ \mu = 2 $ 时达到 60.07% mAP,较基线提升 0.42%,较 $ \lambda = 0 $ 变体提升 0.1%。
  • 在 Kinetics 上,多头 S3D-G 模型在 $ \mu = 2 $ 时达到 75.9% top-1 准确率和 92.3% top-5 准确率,超越了参数量和 FLOP 数相同的基线 S3D-G(74.6% top-1)。
  • 协同蒸馏损失始终优于集成损失结构,尤其在 $ \mu = 2 $ 时表现更优,表明从集成中蒸馏知识比直接监督更有效。
  • 该方法在所有三个基准上均达到最先进性能,且未增加模型大小,证明集成可比单模型训练更高效。
  • 消融实验表明运行间差异极小,证实了该方法在不同训练运行中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。