[論文レビュー] Soft Calibration Objectives for Neural Networks
本稿では、微分可能でソフトバインニングに基づくキャリブレーション目的関数—SB-ECE および S-AvUC—を提案し、ニューラルネットワークのエンドツーエンド学習による予測不確実性のキャリブレーションを向上させる。離散的バインニングを連続的で重複するバインニングに置き換えることで、1%未満の精度低下で最先端の期待キャリブレーション誤差(ECE)を達成し、標準的な交差エントロピー学習や温度スケーリングなどの後処理手法を上回る性能を発揮する。特に分布シフト下でも顕著である。
Optimal decision making requires that classifiers produce uncertainty estimates consistent with their empirical accuracy. However, deep neural networks are often under- or over-confident in their predictions. Consequently, methods have been developed to improve the calibration of their predictive uncertainty both during training and post-hoc. In this work, we propose differentiable losses to improve calibration based on a soft (continuous) version of the binning operation underlying popular calibration-error estimators. When incorporated into training, these soft calibration losses achieve state-of-the-art single-model ECE across multiple datasets with less than 1% decrease in accuracy. For instance, we observe an 82% reduction in ECE (70% relative to the post-hoc rescaled ECE) in exchange for a 0.7% relative decrease in accuracy relative to the cross entropy baseline on CIFAR-100. When incorporated post-training, the soft-binning-based calibration error objective improves upon temperature scaling, a popular recalibration method. Overall, experiments across losses and datasets demonstrate that using calibration-sensitive procedures yield better uncertainty estimates under dataset shift than the standard practice of using a cross entropy loss and post-hoc recalibration methods.
研究の動機と目的
- 深層ニューラルネットワークのキャリブレーションが悪いため、高い精度を示しても過信または過小信頼の予測を生じる問題に対処すること。
- 標準的なキャリブレーション誤差推定器(例:ECE)が離散的バインニングのため微分不能であるという制限を克服し、勾配ベース最適化が不可能である問題に対処すること。
- ハードバインニングの代替として微分可能で連続的な手法を提案し、キャリブレーション誤差の推定を可能にすることで、学習中および後処理によるキャリブレーション最適化を直接行えるようにすること。
- 標準的な交差エントロピー損失に続く後処理手法ではなく、分布シフト下での不確実性推定を改善するため、キャリブレーションに敏感な学習目的関数を用いること。
- ソフトキャリブレーション目的関数が、分布内および分布外の両設定において、従来手法に比べて不確実性推定の一般化性能が優れていることを示すこと。
提案手法
- 信頼度スコアを微分可能関数(例:ガウスカーネル)を用いた重複する連続的バインニングにマッピングするソフトバインニング機構を提案し、離散的ハードバインニングに置き換える。
- 連続的バインニング上の重み付き積分として期待信頼度と正解率を計算することで、ソフトバージョンの期待キャリブレーション誤差(SB-ECE)を定義し、勾配計算を可能にする。
- 非ベイジアンニューラルネットワークにおけるキャリブレーション向上を目的として、AvUC損失のソフトバージョン(S-AvUC)を導入する。
- インターリーブドトレーニングを用いて、主損失(例:交差エントロピー)が記憶(memorization)を引き起こしても、ECEが低く保たれるようにする。
- 後処理キャリブレーションにおいてソフトキャリブレーション目的関数を主損失として採用し、温度パラメータをSB-ECEの最適化により直接最適化する(TS-SB-ECE)。
- ECE計算に等質量バインニングとℓ₂ノルムを用い、CIFAR-10、CIFAR-100、ImageNetの各データセットで、さまざまな主損失およびデータシフト条件下での性能を評価する。
実験結果
リサーチクエスチョン
- RQ1微分可能で連続的なバインニングは、ニューラルネットワーク学習中のキャリブレーション誤差最適化を改善できるか?
- RQ2ソフトキャリブレーション目的関数(SB-ECE、S-AvUC)を補助損失として用いる場合、従来のキャリブレーション指向損失と比較して期待キャリブレーション誤差(ECE)をどれほど低減できるか?
- RQ3後処理キャリブレーションにおいてソフトキャリブレーション誤差を最適化する(例:TS-SB-ECE)ことで、標準的な温度スケーリングを上回る性能が得られるか?
- RQ4ソフトキャリブレーション目的関数は、標準的な交差エントロピー学習と後処理温度スケーリングと比較して、データセットシフト下でも一般化性能が優れているか?
- RQ5ソフトキャリブレーション目的関数は、マルチクラス設定においてトップラベルおよびマージナルキャリブレーション誤差の両方を改善できるか?
主な発見
- S-AvUC補助損失は、データセットおよび主損失のすべてでECEの改善が最大であり、効果量(Cohen’s d)は大または非常に大きな改善を示している。
- CIFAR-100では、交差エントロピーベースラインと比較してECEを82%(後処理再スケーリングECEと比較して70%の相対的低下)低減した一方で、精度の相対的低下はたった0.7%にとどまる。
- TS-SB-ECE(後処理キャリブレーション手法)は、さまざまなデータセットおよびキャリブレーション誤差指標において、標準的な温度スケーリングを常に上回る性能を示した。
- ソフトキャリブレーション目的関数は、標準的な交差エントロピー学習と後処理温度スケーリングよりも、分布シフト下での一般化性能が優れている。
- 交差エントロピーで学習した場合に記憶が生じ(100%の訓練精度を示したが)、ソフトキャリブレーション目的関数はインターリーブドトレーニングによりテスト時のECEを低減した。
- CIFAR-10、CIFAR-100、ImageNetのすべてで、1%未満の精度劣化でSOTAの単一モデルECEを達成し、優れたトレードオフ効率を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。