[論文レビュー] Distance-Based Learning from Errors for Confidence Calibration
本稿では、誤差からの学習に基づく距離(DBLE)という新しい訓練手法を提案する。この手法は、距離に基づく表現空間を学習し、誤分類されたサンプルのみを用いて自信モデルを共同で訓練することで、深層ニューラルネットワークの自信の補正を改善する。DBLEはアンサンブルよりも計算コストが低く、分類性能を損なわずに、単一モデルとしての最先端の補正性能を達成する。
Deep neural networks (DNNs) are poorly calibrated when trained in conventional ways. To improve confidence calibration of DNNs, we propose a novel training method, distance-based learning from errors (DBLE). DBLE bases its confidence estimation on distances in the representation space. In DBLE, we first adapt prototypical learning to train classification models. It yields a representation space where the distance between a test sample and its ground truth class center can calibrate the model's classification performance. At inference, however, these distances are not available due to the lack of ground truth labels. To circumvent this by inferring the distance for every test sample, we propose to train a confidence model jointly with the classification model. We integrate this into training by merely learning from mis-classified training samples, which we show to be highly beneficial for effective learning. On multiple datasets and DNN architectures, we demonstrate that DBLE outperforms alternative single-model confidence calibration approaches. DBLE also achieves comparable performance with computationally-expensive ensemble approaches with lower computational cost and lower number of parameters.
研究の動機と目的
- 標準的な交差エントロピー損失で訓練された深層ニューラルネットワークの信頼性の低い補正を是正すること。
- 後処理による補正やアンサンブル手法に依存せずに、良好な自信推定を可能にする訓練手法を開発すること。
- 表現空間内の距離を活用し、誤分類されたサンプルからの学習によって補正を改善すること。
- 既存の手法と比較して最小限の計算オーバーヘッドで高い補正性能を達成すること。
提案手法
- DBLEは、テストサンプルとその正解クラスの中心との距離がモデルの性能と相関する距離ベースの表現空間で分類モデルを訓練するため、プロトタイプ学習を応用する。
- 推論時、正解ラベルは利用できないため、分類モデルと同時に学習される別個の自信モデルを用いて、真のクラス中心までの距離を推定する。
- 自信モデルは誤分類された訓練サンプルにのみ学習され、誤った予測に対して推定距離を最大化する損失関数が使用される。
- 訓練ステップごとに2回の順伝播を実行する:1回は分類モデル用、もう1回は自信モデル用で、自信モデルは誤りの際にのみ更新される。
- 自信モデルは小さなMLPとして実装されており、主モデルのパラメータの1〜3%しか追加しない。
- 訓練には標準的な最適化手法を用い、学習率スケジューリングを適用し、自信モデルの更新には推定距離に対する負の対数尤度を目的関数として使用する。
実験結果
リサーチクエスチョン
- RQ1距離ベースの表現空間は、深層ニューラルネットワークの自信補正を改善できるか?
- RQ2誤分類されたサンプルからの学習は、計算コストを増加させることなく自信モデルの性能を向上させられるか?
- RQ3共同で訓練された自信モデルは、パラメータ数とトレーニング時間の点で少ないながらも、ディープアンサンブルと同等の補正性能を達成できるか?
- RQ4後処理補正やベイジアンディープラーニング手法と比較して、DBLEは補正性能と推論効率の点でどのように差をつけるか?
主な発見
- ResNet50を用いたCIFAR-100では、DBLEが期待補正誤差(ECE)3.6%を達成し、バニラトレーニング(25.2%)や他のベースラインを顕著に上回る。
- Tiny-ImageNetでは、DBLEがECEを3.6%まで低下させ、バニラトレーニングの25.2%と比較して、データセットをまたいで一貫した改善を示す。
- VGG11を用いたCIFAR-100では、DBLEがECE1.1%を達成し、MCドロップアウトや温度スケーリングを上回り、ディープアンサンブルに近い性能を発揮する。
- CIFAR-100-VGG11ではDBLEのトレーニング時間がバニラトレーニングの1.4倍、CIFAR-100-ResNet50では1.7倍であるが、4ネットワークのディープアンサンブルの4倍に比べてはるかに少ない。
- 自信モデルは主モデルのパラメータの1〜3%しか追加しないが、ディープアンサンブルではパラメータ数が400%増加する。
- アブレーションスタディの結果、距離ベースの表現空間と誤差ベースの学習の両方が不可欠であることが確認された。自信学習に全訓練サンプルを使用すると性能が低下し、誤差学習のみを適用したバニラトレーニングでは僅かな向上にとどまる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。