Skip to main content
QUICK REVIEW

[论文解读] Wisdom of Committees: An Overlooked Approach To Faster and More Accurate Models

Xiaofang Wang, Dan Kondratyuk|arXiv (Cornell University)|Dec 3, 2020
Advanced Neural Network Applications参考文献 40被引用 21
一句话总结

本论文表明,通过将现成的、独立预训练的模型组合成委员会模型(如集成或级联结构),可在图像分类、视频分类和语义分割任务中实现与最先进模型相当或更优的准确率,同时将FLOPs降低至最多5.4倍,优于复杂的神经架构搜索(NAS)方法和人工设计的模型。

ABSTRACT

Committee-based models (ensembles or cascades) construct models by combining existing pre-trained ones. While ensembles and cascades are well-known techniques that were proposed before deep learning, they are not considered a core building block of deep model architectures and are rarely compared to in recent literature on developing efficient models. In this work, we go back to basics and conduct a comprehensive analysis of the efficiency of committee-based models. We find that even the most simplistic method for building committees from existing, independently pre-trained models can match or exceed the accuracy of state-of-the-art models while being drastically more efficient. These simple committee-based models also outperform sophisticated neural architecture search methods (e.g., BigNAS). These findings hold true for several tasks, including image classification, video classification, and semantic segmentation, and various architecture families, such as ViT, EfficientNet, ResNet, MobileNetV2, and X3D. Our results show that an EfficientNet cascade can achieve a 5.4x speedup over B7 and a ViT cascade can achieve a 2.3x speedup over ViT-L-384 while being equally accurate.

研究动机与目标

  • 重新评估委员会模型(集成与级联)作为一种被忽视但可行的高效深度学习范式。
  • 解决委员会模型与现代单模型架构在效率与准确率方面缺乏系统性比较的问题。
  • 证明简单、现成的委员会模型可在无需架构调优的情况下超越复杂、搜索优化的架构。
  • 提供实证证据表明委员会模型在多种任务和模型族(包括ViT、EfficientNet、ResNet、MobileNetV2和X3D)中具有良好的泛化能力。
  • 倡导将委员会模型作为未来模型开发和实际部署中的强基线方法。

提出的方法

  • 通过平均多个独立预训练模型的预测结果构建集成模型,无需微调或特殊加权。
  • 通过顺序应用预训练模型并使用置信度阈值(最大Softmax概率)决定是否提前退出,构建级联模型。
  • 对于语义分割等密集预测任务,将像素级置信度得分的平均值作为图像级置信度得分,以决定是否传递到下一模型。
  • 在分割级联中应用基于网格的推理,其中每个网格单元独立评估是否提前退出,从而减少在困难区域的计算浪费。
  • 使用标准预训练模型(如EfficientNet-B5、ViT-L-384、X3D)作为组件,不进行架构修改或微调。
  • 使用标准指标评估性能:ImageNet的top-1准确率、Cityscapes的mIoU以及Kinetics-600的top-1准确率,以FLOPs和延迟作为效率度量。

实验结果

研究问题

  • RQ1仅使用现成的、预训练的模型构建的简单委员会模型,是否能在准确率和效率上超越最先进单模型?
  • RQ2委员会模型与现代神经架构搜索(NAS)方法相比,在速度-准确率权衡方面表现如何?
  • RQ3级联结构的效率优势是否在不同模型族和任务(包括图像、视频和密集预测任务)中均成立?
  • RQ4级联结构是否能同时提供加速效果和最坏情况下的FLOP保证,使其适用于实时部署?
  • RQ5使用单一模型在多个分辨率下构建自级联结构,是否能实现显著的推理加速且不损失准确率?

主要发现

  • 两个EfficientNet-B5模型的集成模型在ImageNet上的准确率与EfficientNet-B7(SOTA ImageNet模型)相当,但仅使用其55%的FLOPs(20.5B vs. 37B)。
  • ResNet级联模型在ImageNet上的准确率高于Inception-v4,同时FLOPs更少,证明其优于强单模型。
  • EfficientNet级联模型在ImageNet上实现了比EfficientNet-B7快5.4倍的推理速度,且top-1准确率相同。
  • ViT级联模型在ImageNet上达到ViT-L-384的准确率,同时实现2.3倍的加速,并将平均FLOPs降低2.3倍。
  • 在Kinetics-600上,X3D模型的级联结构比X3D-XL高出1.2%的top-1准确率,同时平均FLOPs减少3.7倍。
  • 在语义分割任务中,采用网格级推理的DeepLabv3级联模型比ResNet-101快1.3倍,同时mIoU保持在78.1%的相同水平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。