Skip to main content
QUICK REVIEW

[論文レビュー] Local Calibration: Metrics and Recalibration

Rachel Luo, Aadyot Bhatnagar|arXiv (Cornell University)|Feb 22, 2021
Machine Learning and Data Classification被引用数 5
ひとこと要約

本稿では、事前学習された特徴空間におけるカーネルベースの類似度と信頼度ビン分割を用いて、局所的近傍における予測の信頼性を測定するローカルキャリブレーションエラー(LCE)という指標を導入する。また、事前グループ知識が不要であり、モデル再訓練を必要としないpost-hocなキャリブレーション手法LoReを提案し、LCEを低減することで、画像分類および表形式分類タスクにおける公平性と意思決定の質を向上させる。グローバルキャリブレーション手法に比べ、下流タスクで優れた性能を示す。

ABSTRACT

Probabilistic classifiers output confidence scores along with their predictions, and these confidence scores should be calibrated, i.e., they should reflect the reliability of the prediction. Confidence scores that minimize standard metrics such as the expected calibration error (ECE) accurately measure the reliability on average across the entire population. However, it is in general impossible to measure the reliability of an individual prediction. In this work, we propose the local calibration error (LCE) to span the gap between average and individual reliability. For each individual prediction, the LCE measures the average reliability of a set of similar predictions, where similarity is quantified by a kernel function on a pretrained feature space and by a binning scheme over predicted model confidences. We show theoretically that the LCE can be estimated sample-efficiently from data, and empirically find that it reveals miscalibration modes that are more fine-grained than the ECE can detect. Our key result is a novel local recalibration method LoRe, to improve confidence scores for individual predictions and decrease the LCE. Experimentally, we show that our recalibration method produces more accurate confidence scores, which improves downstream fairness and decision making on classification tasks with both image and tabular data.

研究の動機と目的

  • グローバルキャリブレーション指標(例:ECE)と、単一観測の制約により到達不可能である個々の予測キャリブレーションの理想との間のギャップを埋めるため。
  • 特徴空間における類似サンプルの集合にわたる誤差の集約を通じて、個々の予測レベルでの信頼性を推定するキャリブレーション指標を開発するため。
  • モデル再トレーニングや感受性グループの事前知識を必要とせず、ローカルキャリブレーションエラー(LCE)を低減するpost-hocな再キャリブレーション手法を設計するため。
  • LCEの最小化が、特に低信頼度予測に対して「安全な行動」が利用可能な状況で、公平性および意思決定タスクの性能向上に寄与することを示すため。

提案手法

  • LCEは、事前学習された特徴空間におけるカーネル関数と信頼度ビン分割を用いて定義される類似サンプルの近傍において、平均キャリブレーション誤差を測定することで計算される。
  • 近傍のサイズは帯域幅パラメータγによって制御され、γが大きいとグローバル(大域的)キャリブレーション、γが小さいと個別的(個別的)キャリブレーションに滑らかに内挿可能である。
  • LoReは、局所的近傍統計に基づく予測の再重み付けによりLCEを最小化する非パラメトリックでpost-hocな再キャリブレーション手法である。
  • 類似度は、事前学習されたバックボーン(例:ResNet)からの特徴量を用いたガウスカーネルによって測定され、明示的なグループラベルなしに局所的一般化を可能にする。
  • 理論的分析により、カーネルが有界であればLCEは多項式オーダーのサンプル複雑度で推定可能であり、信頼性の高い経験的推定が可能であることが示された。
  • 再トレーニングなしに適用可能であるため、あらゆる事前学習モデルと互換性があり、実世界のシステムへの容易な導入が可能である。

実験結果

リサーチクエスチョン

  • RQ1個々の予測レベルでの信頼性を捉えるキャリブレーション指標を設計可能か? ただし、個々の誤分類確率の推定は不可能であるという制約がある。
  • RQ2ECEのようなグローバル指標が検出できない、ローカルキャリブレーション指標(例:LCE)が、誤キャリブレーションのパターンを明らかにできるか?
  • RQ3グローバルキャリブレーション性能を損なわず、post-hocな再キャリブレーション手法がLCEを低減可能か?
  • RQ4ローカルキャリブレーションの向上が、特にキャリブレーション時に感受性グループが未知である状況でも、より良い公平性の結果をもたらすか?
  • RQ5低信頼度予測に対して「安全な行動」が利用可能な状況で、LCEの低減が意思決定の質を向上させるか?

主な発見

  • LoReは、再キャリブレーションなしの状況と比較して、最大グループごとのMCEを平均50%低減し、次に優れたグローバル手法に比べ24%の改善を達成した。
  • LoReは、バンド幅パラメータγの広い範囲にわたり、MLCEの低減においてグローバル再キャリブレーション手法を上回り、t-SNEおよびPCA特徴空間の両方で一貫した向上を示した。
  • 最大グループごとのMCEは、ECEのようなグローバル指標よりもMLCEと強く相関しており、LCEが公平性に関連する誤キャリブレーションをよりよく捉えていることを示している。
  • ImageNet意思決定タスクでは、報酬比w/uの広い範囲で、LoReが全ベースラインを上回る最高の合計報酬を達成した。
  • LoReは強いグローバルキャリブレーションを維持し、ImageNetにおいてECE(0.007)、NLL(0.955)、Brierスコア(40.58)のすべての指標で、他の手法と比較して最低を記録した。
  • LoReは、信頼度が低い際の「安全な行動」のより正確な選択を可能にし、システムの有用性を直接的に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。