Skip to main content
QUICK REVIEW

[論文レビュー] MEAL: Multi-Model Ensemble via Adversarial Learning

Zhiqiang Shen, Zhankui He|arXiv (Cornell University)|Dec 6, 2018
Advanced Neural Network Applications参考文献 38被引用数 14
ひとこと要約

MEALは、敵対的学習を用いて複数の事前学習済み深層ニューラルネットワークを1つの学生ネットワークに圧縮する知識蒸留フレームワークを提案する。ソフトラベルと識別器を活用して学生の特徴を多様な教師モデルと一致させることで、MEALは画像分類の最先端性能を達成し、1つのモデルでの推論速度を維持しながら、元のモデルや従来のアンサンブルを上回る性能を発揮する。ImageNetではトップ1誤差21.79%を達成した。

ABSTRACT

Often the best performing deep neural models are ensembles of multiple base-level networks. Unfortunately, the space required to store these many networks, and the time required to execute them at test-time, prohibits their use in applications where test sets are large (e.g., ImageNet). In this paper, we present a method for compressing large, complex trained ensembles into a single network, where knowledge from a variety of trained deep neural networks (DNNs) is distilled and transferred to a single DNN. In order to distill diverse knowledge from different trained (teacher) models, we propose to use adversarial-based learning strategy where we define a block-wise training loss to guide and optimize the predefined student network to recover the knowledge in teacher models, and to promote the discriminator network to distinguish teacher vs. student features simultaneously. The proposed ensemble method (MEAL) of transferring distilled knowledge with adversarial learning exhibits three important advantages: (1) the student network that learns the distilled knowledge with discriminators is optimized better than the original model; (2) fast inference is realized by a single forward pass, while the performance is even better than traditional ensembles from multi-original models; (3) the student network can learn the distilled knowledge from a teacher model that has arbitrary structures. Extensive experiments on CIFAR-10/100, SVHN and ImageNet datasets demonstrate the effectiveness of our MEAL method. On ImageNet, our ResNet-50 based MEAL achieves top-1/5 21.79%/5.99% val error, which outperforms the original model by 2.06%/1.14%. Code and models are available at: https://github.com/AaronHeee/MEAL

研究の動機と目的

  • 従来の深層ニューラルネットワークアンサンブルにおける高い推論コストとストレージ要件を解決すること。
  • 複数の多様な事前学習済み教師ネットワークから、1つの効率的な学生ネットワークに知識を圧縮すること。
  • 異なるアーキテクチャから得られる多様なソフトラベル分布を活用することで、学生モデルの一般化性能とロバスト性を向上させること。
  • 複数モデルのアンサンブルに伴う計算コストを排除し、1回の順伝播で高パフォーマンスな推論を実現すること。
  • 敵対的特徴マッチングが、標準的なソフトラベル伝達を超えて知識蒸留を向上させることを示すこと。

提案手法

  • 学生ネットワークは、複数の事前学習済み教師ネットワークから得られるソフトラベルを用いて訓練され、1ホットエンコーディングよりも豊富で多様な監視信号を提供する。
  • ブロック単位の敵対的訓練損失を導入し、識別器を用いて教師の特徴と学生の特徴を区別することで、学生の特徴表現を教師と一致させる。
  • 敵対的損失により、学生が教師の特徴と区別がつかないような特徴マップを生成するよう促され、より良い知識伝達が実現する。
  • この手法はエンドツーエンド微分可能であり、知識蒸留と敵対的特徴一致の両方を同時に最適化する。
  • アーキテクチャに依存しないフレームワークであり、任意の構造の教師ネットワークから1つの学生モデルに知識蒸留が可能である。
  • 訓練では標準的な交差エントロピー損失に加え、特徴レベルの一致を向上させるための追加の敵対的損失を用いる。

実験結果

リサーチクエスチョン

  • RQ11つの学生ネットワークが、マルチモデルアンサンブルと同等またはそれ以上の性能を発揮しながら、1回の推論コストを維持できるか?
  • RQ2学生と教師ネットワーク間の敵対的特徴マッチングが、標準的なソフトラベル蒸留を超えて知識蒸留を向上させるか?
  • RQ3異なる教師アーキテクチャから得られるソフトラベル分布の多様性が、蒸留された学生モデルの性能に与える影響は何か?
  • RQ4提案手法が、VGG-19やResNet-50を含むさまざまなネットワークアーキテクチャやデータセット、特にImageNetのような大規模ベンチマークでも汎用性を示せるか?
  • RQ5冗長性を最小限に抑えるために、パフォーマンスを最大化する最適な訓練予算とアンサンブルサイズは何か?

主な発見

  • ImageNetでは、ResNet-50ベースのMEALはトップ1検証誤差21.79%、トップ5誤差5.99%を達成し、元のResNet-50(23.85%/7.13%)や従来のアンサンブル(22.76%/6.49%)を上回った。
  • CIFAR-10では、MEALを用いたshake-shakeベースラインのテスト誤差を2.86%から2.54%に改善し、相対的に11.2%の向上を達成した。
  • 同じアーキテクチャであっても、敵対的特徴一致のおかげで、MEALで訓練された学生ネットワークは元のモデルよりも一般化性能が優れている。
  • 推論時においては1回の順伝播を維持しており、FLOPsと推論時間は教師モデルの数に依存しない。
  • 異なる教師アーキテクチャ(例:VGG-19とResNet-50)間のソフトラベル分布の多様性は、より強いモデル同士の比較よりも定量的に高いことが示され、マルチ教師蒸留の有効性を裏付けた。
  • t-SNE可視化により、MEALで訓練された学生ネットワークは、標準的な訓練ベースラインと比較して、より判別力があり、良好に分離された特徴埋め込みを学習していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。