Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial-Based Knowledge Distillation for Multi-Model Ensemble and Noisy Data Refinement

Zhiqiang Shen, Zhankui He|arXiv (Cornell University)|Aug 22, 2019
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、複数モデルアンサンブルを1つの学生ネットワークに圧縮するとともにノイズの多いラベルを精錬する、新たな敵対的ベースの知識蒸留フレームワークMEALを提案する。多様な教師モデルからのソフトラベルと、教師の分布に学生の特徴を一致させるために用いる敵対的訓練を活用することで、MEALは最先端の性能を達成した—ImageNetでは元のResNet-50よりもトップ1誤差が2.06%低く、iMaterialistではトップ3精度が1.15%向上した—一方で、推論には単一のフォワードパスで十分であり、高速な推論が可能である。

ABSTRACT

Generic Image recognition is a fundamental and fairly important visual problem in computer vision. One of the major challenges of this task lies in the fact that single image usually has multiple objects inside while the labels are still one-hot, another one is noisy and sometimes missing labels when annotated by humans. In this paper, we focus on tackling these challenges accompanying with two different image recognition problems: multi-model ensemble and noisy data recognition with a unified framework. As is well-known, usually the best performing deep neural models are ensembles of multiple base-level networks, as it can mitigate the variation or noise containing in the dataset. Unfortunately, the space required to store these many networks, and the time required to execute them at runtime, prohibit their use in applications where test sets are large (e.g., ImageNet). In this paper, we present a method for compressing large, complex trained ensembles into a single network, where the knowledge from a variety of trained deep neural networks (DNNs) is distilled and transferred to a single DNN. In order to distill diverse knowledge from different trained (teacher) models, we propose to use adversarial-based learning strategy where we define a block-wise training loss to guide and optimize the predefined student network to recover the knowledge in teacher models, and to promote the discriminator network to distinguish teacher vs. student features simultaneously. Extensive experiments on CIFAR-10/100, SVHN, ImageNet and iMaterialist Challenge Dataset demonstrate the effectiveness of our MEAL method. On ImageNet, our ResNet-50 based MEAL achieves top-1/5 21.79%/5.99% val error, which outperforms the original model by 2.06%/1.14%. On iMaterialist Challenge Dataset, our MEAL obtains a remarkable improvement of top-3 1.15% (official evaluation metric) on a strong baseline model of ResNet-101.

研究の動機と目的

  • 実世界の応用において多様なモデルアンサンブルが引き起こす高い計算コストとメモリ消費を軽減すること。
  • ノイズや曇ったアノテーション下でも画像認識のロバスト性と精度を向上させること。
  • 多様な事前学習済み教師ネットワークの知識を1つの効率的な学生モデルに圧縮すること。
  • 異なるアーキテクチャからのソフトラベル分布を活用し、1ホットラベルよりも豊かな監視信号を提供すること。
  • モデル一般化性能を向上させるとともに、マルチオブジェクトおよびノイズラベルの課題に対処できる統合フレームワークを開発すること。

提案手法

  • 本手法は、複数の事前学習済み教師モデルのソフトラベル出力を模倣するように訓練される学生ネットワークを用いる。1ホットラベルの代わりに、多様で情報豊富な分布を用いる。
  • ブロック単位の敵対的訓練戦略を導入し、教師と学生のネットワークからの特徴を区別するための識別器を用いて、特徴レベルの整合性を強制する。
  • 学生ネットワークは、ソフトラベルからの知識蒸留損失と識別器からの敵対的損失を組み合わせた損失関数により最適化され、特徴レベルの一般化性能が向上する。
  • 繰り返しの精錬により、教師モデルの更新を経た学生の再訓練を実施し、段階的に監視品質を向上させる。
  • 異なるアーキテクチャ(例:ResNet、DenseNet、VGG)を統合して、多様で情報豊富な監視信号を生成するためのエンドツーエンド学習をサポートする。
  • 推論時にアンサンブルを必要としないため、単一のフォワードパスによる高速な推論が可能である。

実験結果

リサーチクエスチョン

  • RQ1敵対的知識蒸留は、性能を損なわせることなく、多様なモデルアンサンブルを1つの効率的な学生ネットワークに圧縮できるか?
  • RQ2多様な教師モデルからのソフトラベル分布は、ノイズのあるラベルやマルチオブジェクトアノテーションに対してロバスト性を向上させられるか?
  • RQ3教師と学生のネットワーク間での敵対的特徴マッチングは、標準的な蒸留手法よりも優れた一般化性能をもたらすか?
  • RQ4教師-学生ペアの繰り返し精錬は、ノイズのあるデータセットにおけるモデルの精度とロバスト性にどのように影響するか?
  • RQ5異なるアーキテクチャからの監視の多様性は、学生モデルの性能向上にどの程度寄与するか?

主な発見

  • ImageNetでは、ResNet-50ベースのMEALがトップ1検証誤差21.79%、トップ5誤差5.99%を達成し、元のモデルよりもそれぞれ2.06ポイントおよび1.14ポイントの改善を示した。
  • iMaterialist Productsデータセットでは、強力なResNet-101ベースラインよりも公式のトップ3誤差を1.15%改善し、複雑で現実的なデータに対して有効であることを示した。
  • データオーグメンテーション(CutMixおよびコサイン学習率スケジューリング)を適用した場合、ノイズのあるCIFAR-10データセットではテスト誤差が6.89%まで低下し、過学習に対するロバスト性が確認された。
  • 繰り返し再訓練により性能が段階的に向上し、最初のラウンドで最大の向上が得られたことから、監視信号の精錬が有効であることが確認された。
  • CIFAR-10では4つの教師モデルで最適な性能が得られ、予算を増加させた場合、約500エポックで学習が完全に収束した。
  • ソフトマックス出力の可視化から、弱いモデル(例:SqueezeNet、VGG)は強いモデル(例:ResNet、DenseNet)よりもより多様なラベル分布を生成していることが確認され、監視の多様性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。