Skip to main content
QUICK REVIEW

[論文レビュー] Repulsive Deep Ensembles are Bayesian

Francesco D’Angelo, Vincent Fortuin|arXiv (Cornell University)|Jun 22, 2021
Generative Adversarial Networks and Image Synthesis参考文献 72被引用数 16
ひとこと要約

本稿では、重み空間または関数空間におけるカーネル化された反発力を用いてアンサンブル成員間の多様性を強制する、反発的ディープアンサンブルを提案する。これは、KL発散のウォッサーシュタイン勾配フローを介して最大事後確率(MAP)推論を適切なベイズ推論に変換する。この手法は、不確実性推定およびOOD検出を向上させ、標準アンサンブルやSVG Dに比べて真のベイズ後方分布に近づく。

ABSTRACT

Deep ensembles have recently gained popularity in the deep learning community for their conceptual simplicity and efficiency. However, maintaining functional diversity between ensemble members that are independently trained with gradient descent is challenging. This can lead to pathologies when adding more ensemble members, such as a saturation of the ensemble performance, which converges to the performance of a single model. Moreover, this does not only affect the quality of its predictions, but even more so the uncertainty estimates of the ensemble, and thus its performance on out-of-distribution data. We hypothesize that this limitation can be overcome by discouraging different ensemble members from collapsing to the same function. To this end, we introduce a kernelized repulsive term in the update rule of the deep ensembles. We show that this simple modification not only enforces and maintains diversity among the members but, even more importantly, transforms the maximum a posteriori inference into proper Bayesian inference. Namely, we show that the training dynamics of our proposed repulsive ensembles follow a Wasserstein gradient flow of the KL divergence with the true posterior. We study repulsive terms in weight and function space and empirically compare their performance to standard ensembles and Bayesian baselines on synthetic and real-world prediction tasks.

研究の動機と目的

  • 標準ディープアンサンブルに見られる多様性の欠如と収束保証の欠如に起因する、多くの場合に類似関数に収束してしまう問題を解決すること。
  • 異なる重みが等価な関数を生成するというベイズニューラルネットワークにおける非同定性問題を克服すること。これは計算リソースの無駄を生じる。
  • スティン変分勾配降下法(SVGD)にインspiredされた反発力の導入により、ディープアンサンブルにベイズ的収束性を付与すること。
  • 重み空間と関数空間における反発的アンサンブルの性能を、予測不確実性および分布外(OOD)検出の観点から比較すること。
  • 本手法がウォッサーシュタイン発散のKL発散の勾配フローとして理論的に正当化されることを示し、ディープアンサンブルに原理的ベイズ的解釈を与えること。

提案手法

  • ディープアンサンブルの勾配更新ルールにカーネル化された反発項を導入し、モデルの崩壊を防ぎ、関数的多様性を強制する。
  • 訓練ダイナミクスを真の後方分布へのKL発散のウォッサーシュタイン勾配フローとして定式化することで、ベイズ後方分布への収束を可能にする。
  • 関数出力のためのSGE(半パラメトリックガウス過程)近似を用いて、重み空間(WGD)および関数空間(fWGD)の両方で反発を実装する。
  • カーネル関数を用いて、パラメータ空間または関数空間における距離に応じた反発力の大きさを計算する。
  • 1次元回帰およびSVHNをOODデータとして用いたCIFAR-10分類を含む、合成的および実世界のタスクに本手法を適用する。
  • 精度、エントロピー、不確実性キャリブレーションなどの指標を用いて、標準ディープアンサンブル、SVG D、ベイズベースラインと本手法を比較する。

実験結果

リサーチクエスチョン

  • RQ1アンサンブル成員間の反発力を導入することで、関数的多様性が向上し、ディープアンサンブルの崩壊が防止されるか?
  • RQ2ディープアンサンブルの反発的訓練ダイナミクスは、真の後方分布へのKL発散のウォッサーシュタイン勾配フローに対応しているか?
  • RQ3不確実性推定およびOOD検出の観点から、関数空間における反発と重み空間における反発は、どのように比較されるか?
  • RQ4反発的アンサンブルは、標準ディープアンサンブルやSVG Dに比べ、より優れた不確実性キャリブレーションと一般化性能を達成できるか?
  • RQ5本手法は、ベイズニューラルネットワークにおける非同定性問題をどの程度軽減できるか?

主な発見

  • 提案された反発的アンサンブルは、1次元回帰タスクにおいて顕著に改善された不確実性推定を達成し、関数空間手法(fWGD)はHMC後方分布に非常に近い近似を達成した。
  • CIFAR-10では、重み空間における反発的アンサンブル(sge-WGD, ssge-WGD)が、エントロピーを用いたOOD検出で標準ディープアンサンブルやSVG Dを上回り、85.792%の精度と0.051の不確実性スコアを達成した。
  • 関数空間における反発的アンサンブル(kde-fWGD, sge-fWGD)は、重み空間の対応する手法よりも優れた不確実性キャリブレーションを達成し、それぞれ0.282および0.288の不確実性スコアを示した。
  • sge-WGDは、CIFAR-10においてすべての手法の中で最も優れたOOD検出性能を達成し、0.051の不確実性スコアと85.792%の精度を達成した。
  • 関数空間における反発的アンサンブルは、特にデータが限られた領域において、中間の不確実性を捉える能力に優れ、標準アンサンブルおよび重み空間手法を上回った。
  • 理論的分析により、本手法がウォッサーシュタイン発散のKL発散の勾配フローに従うことが確認され、ディープアンサンブルに原理的ベイズ的解釈を与えた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。