Skip to main content
QUICK REVIEW

[論文レビュー] Should Ensemble Members Be Calibrated?

Xixin Wu, Mark Gales|arXiv (Cornell University)|Jan 13, 2021
Anomaly Detection Techniques and Applications参考文献 33被引用数 9
ひとこと要約

本稿では、深層ニューラルネットワークアンサンブルにおけるキャリブレーションを調査し、理論的および実験的に、個々のアンサンブルメンバーのキャリブレーションが、良好にキャリブレートされたアンサンブル予測を保証しないことを示している。代わりに、アンサンブル出力を別々にキャリブレーションする必要がある。動的温度スケーリング—地域別に異なる温度を適用する手法—は、最小限のパラメータの追加で優れたキャリブレーションを実現する。

ABSTRACT

Underlying the use of statistical approaches for a wide range of applications is the assumption that the probabilities obtained from a statistical model are representative of the "true" probability that event, or outcome, will occur. Unfortunately, for modern deep neural networks this is not the case, they are often observed to be poorly calibrated. Additionally, these deep learning approaches make use of large numbers of model parameters, motivating the use of Bayesian, or ensemble approximation, approaches to handle issues with parameter estimation. This paper explores the application of calibration schemes to deep ensembles from both a theoretical perspective and empirically on a standard image classification task, CIFAR-100. The underlying theoretical requirements for calibration, and associated calibration criteria, are first described. It is shown that well calibrated ensemble members will not necessarily yield a well calibrated ensemble prediction, and if the ensemble prediction is well calibrated its performance cannot exceed that of the average performance of the calibrated ensemble members. On CIFAR-100 the impact of calibration for ensemble prediction, and associated calibration is evaluated. Additionally the situation where multiple different topologies are combined together is discussed.

研究の動機と目的

  • アンサンブル予測がキャリブレートされる理論的条件を分析すること。
  • キャリブレートされたアンサンブルメンバーとキャリブレートされたアンサンブル予測の間の乖離を調査すること。
  • 特に温度スケーリングを含む後処理キャリブレーション手法を、ディープアンサンブルモデルに対して評価すること。
  • 異なるアーキテクチャを有するモデルをアンサンブルに組み込む影響を調査すること。
  • 改善されたキャリブレーションを実現するための地域別温度スケーリングの提案と評価

提案手法

  • サンプルベースの限界ではなく、基礎となるデータ分布に基づくキャリブレーション基準の理論的分析。
  • DenseNet、ResNet、およびDenseNetの変種を用いた、CIFAR-100におけるディープアンサンブルを用いたキャリブレーションの実験的評価。
  • 温度スケーリングによる後処理キャリブレーションの適用、これにはグローバル、メンバー単位(事前)、アンサンブルレベル(事後)のモードを含む。
  • モデルの複雑さを著しく増加させずにキャリブレーションを向上させるために、地域ベースの温度パラメータを用いた動的温度スケーリングの導入。
  • 信頼性図と複数のキャリブレーション誤差指標(ECE、ACE、SKCE)を用いた性能評価。
  • トポロジー・アンサンブルにおけるモデル重みの最適化に、最尤推定とAUCを用い、異種アーキテクチャを組み合わせた場合を対象とする。

実験結果

リサーチクエスチョン

  • RQ1個々のアンサンブルメンバーをキャリブレートしても、良好にキャリブレートされたアンサンブル予測が保証されるか?
  • RQ2アンサンブルメンバーのキャリブレーションと最終的なアンサンブル出力のキャリブレーションとの間の理論的関係は何か?
  • RQ3グローバルスケーリングと比較して、地域別温度スケーリングはキャリブレーション性能を向上させるか?
  • RQ4異なるアーキテクチャを有するモデルを組み合わせることは、アンサンブルのキャリブレーションと性能にどのような影響を与えるか?
  • RQ5個々のメンバーの事前キャリブレーションよりも、アンサンブル出力の結合後キャリブレーションが効果的か?

主な発見

  • 個々のアンサンブルメンバーのキャリブレーションは、良好にキャリブレートされたアンサンブル予測を保証しない。アンサンブル出力は依然として過信不足であり、別個のキャリブレーションが必要である。
  • 結合後のキャリブレーション(アンサンブル出力のキャリブレーション)は、結合前のキャリブレーションよりも顕著に優れたキャリブレーション誤差(例:RSNで動的スケーリング時、ECEが1.20×10⁻²に低下)を達成する。
  • 6地域に分けた動的温度スケーリングは、最高のキャリブレーション性能(RSNでSKCE = 57.87×10⁻⁴)を実現し、ECEを1.20×10⁻²まで低下させ、グローバルおよび事前キャリブレーション手法を上回る。
  • 動的温度スケーリングにおける地域数の増加はキャリブレーションを向上させるが、パラメータ数も増加する。
  • LEN、DSN100、DSN121、RSNを組み合わせたトポロジー・アンサンブルは、結合後キャリブレーションを施した場合に83.86%の精度とECE 2.06×10⁻²を達成し、メンバーのキャリブレーション品質に頼らずに安定性を示す。
  • 良好にキャリブレートされたメンバーでさえも、アンサンブル予測は依然として不十分にキャリブレートされており、アンサンブル出力の専用キャリブレーションが不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。