Skip to main content
QUICK REVIEW

[論文レビュー] Wisdom of Committees: An Overlooked Approach To Faster and More Accurate Models

Xiaofang Wang, Dan Kondratyuk|arXiv (Cornell University)|Dec 3, 2020
Advanced Neural Network Applications参考文献 40被引用数 21
ひとこと要約

この論文は、オフザシェルで独立して事前学習されたモデルをアンサンブルまたはカスケードに組み合わせた単純なコミッティベースのモデルが、FLOPsを最大5.4倍まで削減しながら、画像分類、動画分類、セマンティックセグメンテーションのタスクにおいて、SOTAの精度を達成または上回ることを示している。これは、洗練されたニューラルアーキテクチャサーチ(NAS)手法や手動で設計されたモデルを凌駃する。

ABSTRACT

Committee-based models (ensembles or cascades) construct models by combining existing pre-trained ones. While ensembles and cascades are well-known techniques that were proposed before deep learning, they are not considered a core building block of deep model architectures and are rarely compared to in recent literature on developing efficient models. In this work, we go back to basics and conduct a comprehensive analysis of the efficiency of committee-based models. We find that even the most simplistic method for building committees from existing, independently pre-trained models can match or exceed the accuracy of state-of-the-art models while being drastically more efficient. These simple committee-based models also outperform sophisticated neural architecture search methods (e.g., BigNAS). These findings hold true for several tasks, including image classification, video classification, and semantic segmentation, and various architecture families, such as ViT, EfficientNet, ResNet, MobileNetV2, and X3D. Our results show that an EfficientNet cascade can achieve a 5.4x speedup over B7 and a ViT cascade can achieve a 2.3x speedup over ViT-L-384 while being equally accurate.

研究の動機と目的

  • 効率的なディープラーニングのための、見過ごされがちなパラダイムとして、コミッティベースのモデル(アンサンブルおよびカスケード)を再評価すること。
  • 効率性と精度の観点から、コミッティモデルと現代の単一モデルアーキテクチャの間の体系的比較が不足しているという問題に取り組むこと。
  • アーキテクチャのチューニングなしに、複雑で探索最適化されたアーキテクチャを凌駃する、単純でオフザシェルのコミッティモデルが優れていることを実証すること。
  • コミッティモデルがViT、EfficientNet、ResNet、MobileNetV2、X3Dなど、多様なタスクとモデルファミリーに一般化できることを実証的根拠で示すこと。
  • 今後のモデル開発および実用的デプロイメントにおいて、コミッティモデルを強力なベースラインとして提唱すること。

提案手法

  • 再訓練や特別な重み付けを一切行わず、複数の独立して事前学習されたモデルの予測を平均することでアンサンブルを構築する。
  • 事前学習済みモデルを段階的に適用し、信頼度閾値(最大ソフトマックス確率)を用いて早期終了を決定することでカスケードを構築する。
  • セマンティックセグメンテーションなどの密度予測タスクでは、ピクセルごとの信頼度スコアの平均を用いて、各画像の信頼度スコアを計算し、次のモデルに渡すかどうかを決定する。
  • セグメンテーションカスケードではグリッドベースの推論を適用し、各グリッドセルを独立して評価することで、困難な領域での計算の無駄を削減する。
  • アーキテクチャの変更や微調整なしに、標準的な事前学習済みモデル(例:EfficientNet-B5、ViT-L-384、X3D)を成分として使用する。
  • 標準的な指標を用いて性能を評価する:ImageNetのトップ-1精度、CityscapesのmIoU、Kinetics-600のトップ-1精度を指標とし、FLOPsとレイテンシを効率性の指標とする。

実験結果

リサーチクエスチョン

  • RQ1オフザシェルで事前学習されたモデルから構築した単純なコミッティモデルは、精度と効率性の両面でSOTAの単一モデルを上回ることができるか?
  • RQ2速度-精度トレードオフの観点から、コミッティモデルは現代のニューラルアーキテクチャサーチ(NAS)手法と比べてどうか?
  • RQ3カスケードの効率性向上効果は、画像分類、動画分類、密度予測タスクを含む、さまざまなモデルファミリーとタスクにわたって保持されるか?
  • RQ4カスケードは、リアルタイムデプロイメントに適した、スピードアップと最悪ケースのFLOPs保証の両方を提供できるか?
  • RQ5複数の解像度で同じモデルを用いた自己カスケードは、精度を損なわずに顕著な推論速度の向上を達成できるか?

主な発見

  • 2つのEfficientNet-B5モデルのアンサンブルは、EfficientNet-B7(ImageNetにおけるSOTAモデル)と同等の精度を達成するが、FLOPsはわずか55%(20.5B vs. 37B)に抑えられる。
  • ResNetカスケードは、Inception-v4よりも高い精度を達成しながら、FLOPsを少なくしている。これは、強力な単一モデルを凌駃することを示している。
  • EfficientNetカスケードは、EfficientNet-B7と同等のトップ-1精度を達成しながら、5.4倍の高速化を実現している。
  • ViTカスケードは、ImageNetでViT-L-384の精度に達しているが、2.3倍の高速化と平均FLOPsの2.3倍の削減を達成している。
  • Kinetics-600では、X3DモデルのカスケードがX3D-XLを1.2%のトップ-1精度向上で上回り、平均FLOPsを3.7倍も削減している。
  • セマンティックセグメンテーションでは、グリッドレベルの推論を用いたDeepLabv3のカスケードは、ResNet-101よりも1.3倍高速な推論を実現しながら、mIoU 78.1%という同等の精度を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。