Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Negative Correlation Learning for Deep Ensembling

Sebastian Buschjäger, Lukas Pfahler|arXiv (Cornell University)|Nov 5, 2020
Domain Adaptation and Few-Shot Learning参考文献 47被引用数 8
ひとこと要約

本稿では、任意の2回微分可能な損失関数に一般化されたバイアス・バリアンス分解を実現する、深層アンサンブルのための新規フレームワークである一般化負相関学習(GNCL)を提案する。GNCLは、独立学習とエンド・トゥ・エンドのアンサンブル学習の間を滑らかに補間可能であり、小容量ネットワークでは結合学習(高分散)が性能を向上させるのに対し、大容量ネットワークでは独立学習(低分散)が、強制的な分散によって生じるバイアスの低減により優位であることが明らかになった。

ABSTRACT

Ensemble algorithms offer state of the art performance in many machine learning applications. A common explanation for their excellent performance is due to the bias-variance decomposition of the mean squared error which shows that the algorithm's error can be decomposed into its bias and variance. Both quantities are often opposed to each other and ensembles offer an effective way to manage them as they reduce the variance through a diverse set of base learners while keeping the bias low at the same time. Even though there have been numerous works on decomposing other loss functions, the exact mathematical connection is rarely exploited explicitly for ensembling, but merely used as a guiding principle. In this paper, we formulate a generalized bias-variance decomposition for arbitrary twice differentiable loss functions and study it in the context of Deep Learning. We use this decomposition to derive a Generalized Negative Correlation Learning (GNCL) algorithm which offers explicit control over the ensemble's diversity and smoothly interpolates between the two extremes of independent training and the joint training of the ensemble. We show how GNCL encapsulates many previous works and discuss under which circumstances training of an ensemble of Neural Networks might fail and what ensembling method should be favored depending on the choice of the individual networks. We make our code publicly available under https://github.com/sbuschjaeger/gncl

研究の動機と目的

  • 任意の2回微分可能な損失関数に対して、平均二乗誤差を超える一般化されたバイアス・バリアンス分解を形式化すること。
  • 独立学習とエンド・トゥ・エンド学習の間を滑らかに補間可能な統一フレームワーク、GNCLを構築すること。
  • アンサンブルが失敗する状況と、ベースラーナーの容量に応じて、分散を強制する学習と独立学習のどちらが好ましいかを特定すること。
  • さまざまなネットワーク容量において、GNCLが最先端のアンサンブル技術を凌駕することを実証的に検証すること。

提案手法

  • アンサンブルの分散が損失関数のヘッセ行列とエキスパート出力の共分散に明示的に関連することを示す一般化されたバイアス・バリアンス分解を導出する。
  • ハイパーパrameter λ を用いて、独立学習(λ=0)とエンド・トゥ・エンド学習(λ=1)の間を補間する正則化スキームとしてGNCLを提案する。
  • 損失関数のヘッセ行列を用いて負相関ペナルティの重みを設定し、特定の損失関数に適応した分散制御を可能にする。
  • 各アンサンブルメンバーが共有損失と出力共分散ペナルティを用いて学習される、共有重み・マルチヘッドアーキテクチャにGNCLを適用する。
  • 個々のモデル損失と、λおよびヘッセ行列に依存する分散促進項を組み合わせた統一された学習目的関数を採用する。
  • 小、中、大容量のニューラルネットワークを用いて性能を評価し、バイアスとバリアンスに及ぼす分散の影響を分析する。

実験結果

リサーチクエスチョン

  • RQ1平均二乗誤差を超えて、任意の2回微分可能な損失関数に対してバイアス・バリアンス分解を一般化する方法は何か?
  • RQ2深層アンサンブルにおいて、分散を強制することが性能に悪影響を及える状況はどのようなものか?
  • RQ3個々のベースラーナーの容量が、アンサンブルの最適な分散レベルにどのように影響するか?
  • RQ4bagging や boosting やエンド・トゥ・エンド学習といった既存のアンサンブル手法を統一的に一般化できるフレームワーク(例:GNCL)は存在するか?
  • RQ5深層ニューラルネットワークアンサンブルにおいて、分散と個々のモデル性能の最適なトレードオフは何か?

主な発見

  • 小容量のバイナリ化ニューラルネットワークでは、高分散を実現するエンド・トゥ・エンド学習(λ=1.0)が、独立学習やSMCLを上回る最高のテスト精度を達成した。
  • SMCLはGNCL(λ=0.8)と同程度の分散レベルを示したが、性能は著しく劣り(約5%の精度差)、これは分散そのものが十分ではなく、適切な最適化が不可欠であることを示している。
  • 中容量モデルでは、GNCL(λ=0.8–0.9)がピーク性能を記録し、ベースモデルがより表現力を持つ場合、中程度の分散が最適であることが示された。
  • 大容量モデルでは、λが0.7を超えると性能が低下した。これは、ベースモデルがすでにバイアスが小さい状態であるため、高分散が性能を損なう可能性があることを示している。
  • エンド・トゥ・エンド学習は、すべての設定で最低の訓練損失を達成したが、特に大容量モデルでは最良のテスト精度をもたらさなかった。
  • 結果から、最適なアンサンブル戦略はベースモデルの容量に依存することが確認された:小容量モデルでは結合学習が、大容量モデルでは独立学習が好ましい。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。