Skip to main content
QUICK REVIEW

[論文レビュー] EnsembleNet: End-to-End Optimization of Multi-headed Models

Hanhan Li, Joe Yue-Hei Ng|arXiv (Cornell University)|May 24, 2019
Advanced Neural Network Applications参考文献 32被引用数 14
ひとこと要約

EnsembleNetは、複数の予測ヘッドを同時に最適化するためのエンドツーエンドで1段階の学習フレームワークを提案する。協調蒸留損失を用いることで、同等サイズの単一モデルを上回る優れた性能を達成する。ImageNet、YouTube-8M、Kineticsの各ベンチマークで、より小さなモデルと手動の介入なしに最先端の結果を達成した。

ABSTRACT

Ensembling is a universally useful approach to boost the performance of machine learning models. However, individual models in an ensemble were traditionally trained independently in separate stages without information access about the overall ensemble. Many co-distillation approaches were proposed in order to treat model ensembling as first-class citizens. In this paper, we reveal a deeper connection between ensembling and distillation, and come up with a simpler yet more effective co-distillation architecture. On large-scale datasets including ImageNet, YouTube-8M, and Kinetics, we demonstrate a general procedure that can convert a single deep neural network to a multi-headed model that has not only a smaller size but also better performance. The model can be optimized end-to-end with our proposed co-distillation loss in a single stage without human intervention.

研究の動機と目的

  • 従来のアンサンブル学習における非効率さと性能の劣化を是正する。具体的には、アンサンブル内の各モデルが互いの存在を認識しない独立した学習が行われる点を改善する。
  • モデルアンサンブルにおける手動のハイパーパramータチューニングや分離された学習段階の必要性を排除する。
  • モデルサイズやFLOPsを維持または削減しつつ、単一モデルを上回る精度を達成する。
  • アンサンブルと蒸留を、明示的な真値回帰を必要としない、よりシンプルで効果的な協調蒸留損失によって統合する。

提案手法

  • 共有のベース特徴を有するマルチヘッドニューラルネットワークアーキテクチャを提案する。
  • 各ヘッドが真値に直接回帰するのではなく、アンサンブル出力を予測することを促進する協調蒸留損失を用いる。
  • すべてのヘッドとアンサンブルヘッドが協調蒸留損失を用いて同時に最適化される1段階の学習手順を採用する。
  • 協調蒸留損失は $ \mathcal{L}_{\text{co-distill}} = \sum_{i=1}^{N} \ell(\mathbf{p}_{\text{ens}}, \mathbf{p}_i) $ で定義され、ここで $ \mathbf{p}_{\text{ens}} $ はアンサンブル予測、$ \mathbf{p}_i $ はヘッド $ i $ の予測である。
  • 推論時におけるアンサンブル出力 $ \mathbf{p}_{\text{ens}} $ は、すべての個別ヘッド予測の平均として計算される。
  • 個別ヘッドに対して明示的な真値監督を避け、知識蒸留による情報伝達に完全に依存する。

実験結果

リサーチクエスチョン

  • RQ1同等サイズの単一モデルを上回る性能を達成できるように、マルチヘッドモデルを1段階のエンドツーエンド学習で訓練可能か?
  • RQ2協調蒸留は、従来のアンサンブル学習や混合アンサンブル/蒸留損失構造と比較して、精度と効率の点で優れているか?
  • RQ3モデルアンサンブルが単一モデルよりも小さくても、依然として精度で上回ることができるか?
  • RQ4アンサンブルと知識蒸留の間には、理論的かつ実証的に利用可能な関係があるか?
  • RQ5提案手法は、ImageNet、YouTube-8M、Kineticsのような多様な大規模ビジョンベンチマークに一般化可能か?

主な発見

  • ImageNetでは、2本のブランチと $ \mu = 2 $ を用いたEnsembleNetが、226Mパラメータと410M FLOPsでトップ-1精度88.36%を達成し、同程度のサイズの単一モデルを上回った。
  • YouTube-8Mでは、$ \mu = 2 $ の協調蒸留損失が60.07%のmAPを達成し、ベースラインより0.42%向上、$ \lambda = 0 $ のバリアントより0.1%向上した。
  • Kineticsでは、$ \mu = 2 $ のマルチヘッドS3D-Gモデルがトップ-1精度75.9%、トップ-5精度92.3%を達成し、同じパラメータ数とFLOP数のベースラインS3D-G(トップ-1 74.6%)を上回った。
  • 協調蒸留損失は、特に $ \mu = 2 $ の場合に、アンサンブル損失構造を常に上回った。これは、アンサンブルからの蒸留が真値への直接的監督よりも効果的であることを示している。
  • モデルサイズを増加させることなく、すべての3つのベンチマークで最先端の性能を達成した。これは、アンサンブル化が単一モデル学習よりも効率的である可能性を示している。
  • アブレーションスタディの結果、ランダムな実行間での変動が最小限に抑えられており、本手法の訓練ランにわたるロバスト性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。