Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Diversity-Driven Ensemble for Deep Neural Networks

Wentao Zhang, Jiawei Jiang|arXiv (Cornell University)|Dec 26, 2021
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、事前学習モデルから一般化された知識を選択的に転送し、多様性駆動型損失関数で最適化することで、トレーニングを高速化するとともに、深層ニューラルネットワークアンサンブルの多様性を向上させる、新しい手法Efficient Diversity-Driven Ensemble (EDDE)を提案する。EDDEは、コンピュータビジョンおよび自然言語処理の両タスクにおいて、従来手法よりも低いトレーニングコストで最先端のアンサンブル精度を達成する。

ABSTRACT

The ensemble of deep neural networks has been shown, both theoretically and empirically, to improve generalization accuracy on the unseen test set. However, the high training cost hinders its efficiency since we need a sufficient number of base models and each one in the ensemble has to be separately trained. Lots of methods are proposed to tackle this problem, and most of them are based on the feature that a pre-trained network can transfer its knowledge to the next base model and then accelerate the training process. However, these methods suffer a severe problem that all of them transfer knowledge without selection and thus lead to low diversity. As the effect of ensemble learning is more pronounced if ensemble members are accurate and diverse, we propose a method named Efficient Diversity-Driven Ensemble (EDDE) to address both the diversity and the efficiency of an ensemble. To accelerate the training process, we propose a novel knowledge transfer method which can selectively transfer the previous generic knowledge. To enhance diversity, we first propose a new diversity measure, then use it to define a diversity-driven loss function for optimization. At last, we adopt a Boosting-based framework to combine the above operations, such a method can also further improve diversity. We evaluate EDDE on Computer Vision (CV) and Natural Language Processing (NLP) tasks. Compared with other well-known ensemble methods, EDDE can get highest ensemble accuracy with the lowest training cost, which means it is efficient in the ensemble of neural networks.

研究の動機と目的

  • 無選択的な知識転送による高コストと低多様性を引き起こす既存のアンサンブル手法の非効率性を是正すること。
  • 限られたトレーニング予算のもとで、ベースモデルの精度と多様性を同時に最大化することにより、アンサンブルの一般化性能を向上させること。
  • 収束を加速するために、事前学習モデルから一般化された特徴のみを効果的に転送する知識転送メカニズムを構築すること。
  • ベースモデル間の負の相関を明示的に最適化する新しい多様性測定指標と多様性駆動型損失関数を導入すること。
  • さらに多様性を向上させ、アンサンブル性能を強化するために、ブースティングに基づくフレームワークを統合すること。

提案手法

  • ベースモデル間のソフトラベル予測の負の相関に基づく新しい多様性測定指標を提案する。
  • 標準的な交差エントロピー損失と、モデル出力の負の相関を促進する正則化項を組み合わせた多様性駆動型損失関数を導入する。
  • 事前学習モデルの低層部からのみ一般化された特徴を転送する、選択的知識転送戦略を設計する。
  • 各ベースモデルを順次トレーニングするブースティングに基づくトレーニングフレームワークを採用し、知識転送と多様性最適化を統合する。
  • 損失関数における精度と多様性のトレードオフを制御するためのハイパーパrameter γ を用いることで、制御された最適化を可能にする。
  • 評価のため、コンピュータビジョン(CIFAR-100、ImageNet)および自然言語処理(GLUEベンチマーク)タスクに本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1選択的知識転送は、深層ニューラルネットワークアンサンブルにおけるモデル多様性を低下させることなく、トレーニング効率を向上させることができるか?
  • RQ2ベースモデル間の負の相関を促進する多様性駆動型損失関数は、より高いアンサンブル精度をもたらすか?
  • RQ3選択的知識転送と多様性最適化と組み合わせたブースティングベースのフレームワークは、さらなる多様性向上と性能向上を実現できるか?
  • RQ4ハイパーパrameter γ によって制御される精度と多様性のトレードオフは、最終的なアンサンブル性能にどのように影響するか?
  • RQ5同じ予算条件下で、EDDEは既存のアンサンブル手法よりも精度とトレーニングコストの両面で優れているか?

主な発見

  • EDDEは、200エポックのトレーニング予算のもとで、ResNet-32を用いたCIFAR-100において74.38%の最高アンサンブル精度を達成し、すべてのベースラインを上回った。
  • 最適なハイパーパrameter γ = 0.1 が、多様性と精度の最良のバランスを実現し、最高のアンサンブル性能をもたらした。
  • γ = 0(通常の損失)のEDDEは73.86%の精度を達成し、多様性駆動型損失が標準トレーニングよりも性能向上をもたらすことを確認した。
  • 全知識転送(EDDE (transfer all))のEDDEは73.37%の精度を達成したが、多様性は低い(0.1631)であり、転送戦略におけるトレードオフが顕在化した。
  • 知識転送なし(EDDE (transfer none))のEDDEは、最高の多様性(0.1854)を達成したが、最低の精度(70.78%)であった。これは、限られた予算下で収束を実現するには知識転送が不可欠であることを示している。
  • EDDEは、転送学習を組み合わせたAdaBoost.NC(72.64%の精度)を上回り、多様性と精度のバランスに優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。