[論文レビュー] Calibrated Selective Classification
この論文では、信頼度推定が信頼できない例を拒否する別個のセレクターネットワークを訓練することで、選択的分類における不確実性のキャリブレーションを向上させる、選択的キャリブレーションというフレームワークを提案する。この手法は、入力の摂動を用いた分布的に頑健な最適化を採用し、分布シフト下でも一般化性能を向上させ、画像分類および医療分類タスクにおいて、信頼度ベースのベースラインと比較して顕著に低い選択的キャリブレーション誤差を達成する。
Selective classification allows models to abstain from making predictions (e.g., say "I don't know") when in doubt in order to obtain better effective accuracy. While typical selective models can be effective at producing more accurate predictions on average, they may still allow for wrong predictions that have high confidence, or skip correct predictions that have low confidence. Providing calibrated uncertainty estimates alongside predictions -- probabilities that correspond to true frequencies -- can be as important as having predictions that are simply accurate on average. However, uncertainty estimates can be unreliable for certain inputs. In this paper, we develop a new approach to selective classification in which we propose a method for rejecting examples with "uncertain" uncertainties. By doing so, we aim to make predictions with {well-calibrated} uncertainty estimates over the distribution of accepted examples, a property we call selective calibration. We present a framework for learning selectively calibrated models, where a separate selector network is trained to improve the selective calibration error of a given base model. In particular, our work focuses on achieving robust calibration, where the model is intentionally designed to be tested on out-of-domain data. We achieve this through a training strategy inspired by distributionally robust optimization, in which we apply simulated input perturbations to the known, in-domain training data. We demonstrate the empirical effectiveness of our approach on multiple image classification and lung cancer risk assessment tasks.
研究の動機と目的
- 選択的分類モデルが、不確実な入力を避ける場合でさえも、 poorly calibrated(不適切にキャリブレートされた)予測を下すという限界を解消すること。
- モデルが予測を行う際に、正確さに加えて、受け入れられた例の不確実性推定値についても適切にキャリブレートされていることを保証すること。
- ベースモデルの信頼度が不適切にキャリブレートされている場合でも、信頼性の低い信頼度推定値を持つ予測についても、単に低信頼度の予測だけでなく、それらをもってして「不確実な」信頼度を持つものも拒否できるフレームワークを開発すること。
- 分布的に頑健な最適化を用いて、分布シフト下でのキャリブレーションの頑健性を向上させること。具体的には、摂動を加えた域内データを用いてセレクタを訓練することで実現する。
- 特に医療診断のような高リスクな応用分野において、十分な予測カバレッジを維持しながら、強力な選択的キャリブレーションを達成すること。
提案手法
- ベースモデル f(X) が信頼度推定を提供し、別個のセレクタ g(X) が不確実性の信頼性に基づいて予測の受容または拒否を決定する二段階フレームワークを提案する。
- 選択的キャリブレーションという新しいキャリブレーション性質を導入する:すべての α に対して、E[Y | f(X)=α, g(X)=1] = α が成り立つ(ただし、f が受け入れられた例に制限された範囲内に限る)。
- セレクターネットワークを最適化するための新しい訓練目的を提案し、S-MMCE(選択的マルチクラス期待キャリブレーション誤差)に基づく。
- 域内訓練データに対して入力摂動をシミュレートすることで、分布的に頑健な最適化を適用し、域外分布への一般化を向上させる。
- 多様で現実的である分布シフトを訓練中に生成するために、摂動ファミリー T(例:AugMix)を用いる。これにより、頑健性が向上する。
- 拒否意思決定の微分可能リラクゼーションを用いて、セレクタをエンドツーエンドで勾配ベース最適化可能に訓練する。
実験結果
リサーチクエスチョン
- RQ1集計的にだけでなく、受け入れられた例のサブセットに対しても、予測が適切にキャリブレートされるような選択的分類システムを設計できるか?
- RQ2ベースモデルの信頼度が不適切にキャリブレートされている場合でも、不確実性推定値の信頼性を向上させることは可能か?
- RQ3摂動を加えた域内データを用いて訓練されたセレクターネットワークは、域外分布に一般化できるか? また、その際、選択的キャリブレーションを維持できるか?
- RQ4信頼度そのものではなく、信頼度の不確実性に基づいて例を拒否することで、特にレアクラスや難易度の高い例において、クラス間の予測カバレッジのバランスが改善されるか?
- RQ5摂動ファミリー T の選択が、最終的な選択的分類器の頑健性およびキャリブレーション性能にどのように影響するか?
主な発見
- 提案された S-MMCE を用いたセレクタは、CIFAR-10-C における分布シフト下で、信頼度ベースのベースラインと比較して、顕著に低い選択的キャリブレーション誤差 AUC(例:0.028 対 0.062)を達成する。
- MGH 肺がんリスク評価データセットでは、90% のカバレッジ下で、信頼度ベースの手法よりもがん患者(Y=1)の拒否数が少ない。これにより、拒否率の不均衡が軽減される。
- 受け入れられた例における信頼度スコアの分布が、周辺分布とよく一致しており、クラス間でモデルの挙動が良好に保持されていることが示唆される。
- アブレーションスタディの結果、訓練時に摂動(T)を用いることで、それなしに訓練した場合と比較して、選択的キャリブレーション誤差が50%以上改善される。
- ベースモデル f(X) が AugMix の摂動を用いて訓練されていなくても、提案されたセレクタは顕著に低い選択的キャリブレーション誤差を達成する。これは、後処理キャリブレーションツールとしての有効性を示している。
- 本手法は分布シフト下でも良好に一般化され、標準的な信頼度ベースの拒否戦略とは異なり、域外データにおいても低キャリブレーション誤差を維持する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。