Skip to main content
QUICK REVIEW

[论文解读] Collaboration of Experts: Achieving 80% Top-1 Accuracy on ImageNet with 100M FLOPs

Yikang Zhang, Zhuo Chen|arXiv (Cornell University)|Jul 8, 2021
Advanced Neural Network Applications参考文献 42被引用 7
一句话总结

本文提出协作专家(CoE)框架,一种硬件高效的方法,在仅使用194M FLOPs时实现ImageNet上80.7%的top-1准确率,结合PWLU与CondConv后,在100M FLOPs下实现80.0%的准确率。CoE通过一个调度器为每个输入选择专家,并采用权重生成模块(WGM)与标签生成模块(LGM)进行联合适应训练,实现动态、低延迟推理。

ABSTRACT

In this paper, we propose a Collaboration of Experts (CoE) framework to pool together the expertise of multiple networks towards a common aim. Each expert is an individual network with expertise on a unique portion of the dataset, which enhances the collective capacity. Given a sample, an expert is selected by the delegator, which simultaneously outputs a rough prediction to support early termination. To fulfill this framework, we propose three modules to impel each model to play its role, namely weight generation module (WGM), label generation module (LGM) and variance calculation module (VCM). Our method achieves the state-of-the-art performance on ImageNet, 80.7% top-1 accuracy with 194M FLOPs. Combined with PWLU activation function and CondConv, CoE further achieves the accuracy of 80.0% with only 100M FLOPs for the first time. More importantly, our method is hardware friendly and achieves a 3-6x speedup compared with some existing conditional computation approaches.

研究动机与目标

  • 解决集成模型因需多次前向传播而导致的高推理成本问题。
  • 克服动态卷积方法在硬件上效率低下的问题,后者因高内存访问成本与低并行性而受限。
  • 开发一种训练范式,使调度器与多个专家在训练中实现协同适应,以提升泛化能力与效率。
  • 在保持硬件友好性的同时,以极低的FLOPs实现最先进水平的准确率,便于实际部署。
  • 通过将CoE应用于神经机器翻译任务,证明其在图像分类之外的泛化能力。

提出的方法

  • 提出一种CoE框架,包含一个调度器与多个专家,其中调度器进行粗略预测并选择一个专家进行细化。
  • 使用权重生成模块(WGM)求解平衡运输问题,根据调度器输出对训练数据进行划分,并重新加权专家损失,使每个专家专注于不同的数据子集。
  • 采用标签生成模块(LGM)通过平衡运输问题生成one-hot选择标签,为调度器的专家选择提供监督信号。
  • 通过联合训练使调度器与专家实现协同适应:WGM确保专家在数据子集上实现专业化,LGM则引导调度器选择最合适的专家。
  • 将CoE与现有技术(如PWLU与CondConv)结合,以极小的FLOP增加进一步提升准确率。
  • 通过仅在推理时加载选定的专家,实现硬件效率,从而最小化内存访问成本并最大化并行性。

实验结果

研究问题

  • RQ1协作专家框架是否能在低FLOP消耗下实现高准确率,同时保持硬件高效?
  • RQ2在训练过程中,如何实现调度器与专家的协同适应,以避免过拟合并提升泛化能力?
  • RQ3调度器所学习的专家选择模式是否反映有意义的样本复杂度,例如将更难的样本分配给更重的专家?
  • RQ4CoE是否能泛化到图像分类以外的任务,如神经机器翻译?
  • RQ5与基于门控值的优化方法相比,所提出的训练算法在准确率与效率方面表现如何?

主要发现

  • CoE在仅使用194M FLOPs时,ImageNet上top-1准确率达到80.7%,显著优于集成方法(920M FLOPs时为79.6%)。
  • 通过将CoE与PWLU及CondConv结合,作者在仅100M FLOPs下实现80.0%的top-1准确率——这是该领域文献中的首次成果。
  • CoE优于SOTA动态方法BasisNet(198M FLOPs时为80.0%),且因更低的内存访问成本,在硬件上实现3.1倍的加速。
  • 在WMT 2014英德翻译任务中,CoE-Transformer实现29.4 BLEU,仅需62.5M MAC与138.2M参数,性能与Transformer(big)相当,但资源消耗更少。
  • 分析表明,调度器学习到了可解释的选型模式:更复杂的样本(以TCP衡量)更常被分配给更重的专家,表明实现了有效专业化。
  • 消融实验确认WGM与LGM均不可或缺:移除任一模块将导致准确率下降1.9–2.9个百分点,证明二者在协同适应中起关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。