Skip to main content
QUICK REVIEW

[論文レビュー] A Consistent and Differentiable Lp Canonical Calibration Error Estimator

Teodora Popordanoska, Raphael Sayer|arXiv (Cornell University)|Oct 13, 2022
Adversarial Robustness in Machine Learning被引用数 9
ひとこと要約

本稿では、多クラス確率的分類器における$L_p$正準キャリブレーション誤差の一貫性・微分可能・実行可能推定器を、ディリクレ核密度推定を用いて提案する。この手法は、$\mathcal{O}(n^2)$の計算量と$\mathcal{O}(n^{-1/2})$の収束速度を有し、効率的なミニバッチ学習と正則化を可能にするとともに、完全な分布キャリブレーションにおいて、既存の推定器よりも一貫性とスケーラビリティに優れる。

ABSTRACT

Calibrated probabilistic classifiers are models whose predicted probabilities can directly be interpreted as uncertainty estimates. It has been shown recently that deep neural networks are poorly calibrated and tend to output overconfident predictions. As a remedy, we propose a low-bias, trainable calibration error estimator based on Dirichlet kernel density estimates, which asymptotically converges to the true $L_p$ calibration error. This novel estimator enables us to tackle the strongest notion of multiclass calibration, called canonical (or distribution) calibration, while other common calibration methods are tractable only for top-label and marginal calibration. The computational complexity of our estimator is $\mathcal{O}(n^2)$, the convergence rate is $\mathcal{O}(n^{-1/2})$, and it is unbiased up to $\mathcal{O}(n^{-2})$, achieved by a geometric series debiasing scheme. In practice, this means that the estimator can be applied to small subsets of data, enabling efficient estimation and mini-batch updates. The proposed method has a natural choice of kernel, and can be used to generate consistent estimates of other quantities based on conditional expectation, such as the sharpness of a probabilistic classifier. Empirical results validate the correctness of our estimator, and demonstrate its utility in canonical calibration error estimation and calibration error regularized risk minimization.

研究の動機と目的

  • 正準(分布)キャリブレーションのための一貫性・微分可能・スケーラブルな推定器の欠如を解決すること。
  • バケット化推定器(一貫性なし)、MMCE(一貫性なし)、Mix-n-Match(高次元で実行不能)といった既存手法の限界を克服すること。
  • 微分可能で一貫性のある損失を提供することで、キャリブレーション誤差正則化付きのエンドツーエンド学習を可能にすること。
  • 有限標本性能を向上させるために、幾何級数に基づくバイアス補正スキームを考案し、バイアスを$\mathcal{O}(n^{-2})$に低減すること。
  • 多様なアーキテクチャとデータセットにおいて、キャリブレーション正則化付きリスク最小化への推定器の有効性を実証すること。

提案手法

  • 確率単体領域に適した自然なカーネル選択を用いたディリクレ核密度推定(KDE)を採用し、条件付きクラス確率の正確な密度推定を可能にする。
  • 有限標本精度を向上させるために、幾何級数に基づくバイアス補正スキームを採用し、バイアスを$\mathcal{O}(n^{-1})$から$\mathcal{O}(n^{-2})$に低減する。
  • 単体上での予測確率と真の条件付き確率の差の$L_p$ノルムを統合することで、微分可能な$L_p$正準キャリブレーション誤差推定器を導出する。
  • バンド幅選択にはleave-one-out最尤推定を、比較にはDoaneの公式によるビン分割を適用し、公平な評価を確保する。
  • 推定器の微分可能性を活かしてミニバッチ更新を可能にし、キャリブレーション正則化付き学習における確率的最適化を支援する。
  • 条件付き期待値に基づく定式化を用いて、シャープネスなどの関連量の推定にもフレームワークを拡張する。

実験結果

リサーチクエスチョン

  • RQ1高次元確率単体にスケーリング可能な、$L_p$正準キャリブレーション誤差のための一貫性・微分可能な推定器を構築できるか?
  • RQ2標準的なバケット化推定器(例:$ECE^{bin}$)と比較して、本稿で提案するKDEベース推定器のバイアスと収束速度はどのように異なるか?
  • RQ3幾何級数によるバイアス補正スキームは、キャリブレーション誤差推定器の有限標本性能をどの程度向上させるか?
  • RQ4キャリブレーション正則化付きリスク最小化において、この推定器はモデルのキャリブレーションを向上させつつ、精度を損なわずに有効に利用できるか?
  • RQ5この推定器は、多様なディープラーニングアーキテクチャと多クラスデータセットにおいて、頑健で信頼性があるか?

主な発見

  • 提案された$ECE^{KDE}$推定器は、漸近的一貫性と$\mathcal{O}(n^{-1/2})$の収束速度を達成しており、理論的期待と一致する。
  • 推定器は$ECE^{bin}$と同程度のバイアスと収束行動を示すが、微分可能性と高次元へのスケーラビリティという追加的利点を有する。
  • 幾何級数によるバイアス補正スキームにより、バイアスが$\mathcal{O}(n^{-2})$に低減され、有限標本精度が顕著に向上した。
  • 実験的結果から、$ECE^{KDE}$はCIFAR-10やCIFAR-100を含む複数のデータセットで一貫した推定を示し、さまざまな標本サイズでも安定した性能を発揮した。
  • キャリブレーション正則化付き学習において、モデルのキャリブレーションが向上した(例:ResNet-110を用いたCIFAR-100では$ECE$が12.769から8.969に低下)。精度は維持された。
  • 推定器により効果的なミニバッチ更新が可能となり、ディープラーニングパイプラインにおけるエンドツーエンド学習に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。