[論文レビュー] Calibrating Deep Neural Network Classifiers on Out-of-Distribution Datasets
本稿では、外分布(OOD)データにおける深層ニューラルネットワーク分類器の信頼度推定を向上させるため、誤分類されたサンプルと正しいサンプルを分離するために補助クラスを導入するpost-hoc補正手法CCAC(Confidence Calibration with an Auxiliary Class)を提案する。この手法により、OODデータにおける過剰な自信(overconfidence)が顕著に低減される。CCACは、画像およびテキスト分類タスクの両方で期待補正誤差(ECE)およびブライアスコアにおいて、先行手法を常に上回り、簡素化されたバージョン(CCAC-S)により、新しいOODデータセットへの効率的な転送が可能になる。
To increase the trustworthiness of deep neural network (DNN) classifiers, an accurate prediction confidence that represents the true likelihood of correctness is crucial. Towards this end, many post-hoc calibration methods have been proposed to leverage a lightweight model to map the target DNN's output layer into a calibrated confidence. Nonetheless, on an out-of-distribution (OOD) dataset in practice, the target DNN can often mis-classify samples with a high confidence, creating significant challenges for the existing calibration methods to produce an accurate confidence. In this paper, we propose a new post-hoc confidence calibration method, called CCAC (Confidence Calibration with an Auxiliary Class), for DNN classifiers on OOD datasets. The key novelty of CCAC is an auxiliary class in the calibration model which separates mis-classified samples from correctly classified ones, thus effectively mitigating the target DNN's being confidently wrong. We also propose a simplified version of CCAC to reduce free parameters and facilitate transfer to a new unseen dataset. Our experiments on different DNN models, datasets and applications show that CCAC can consistently outperform the prior post-hoc calibration methods.
研究の動機と目的
- 深層ニューラルネットワーク分類器が外分布(OOD)テストデータにデプロイされた際の過剰な自信の予測という課題に対処すること。
- OOD誤分類を考慮したpost-hoc手法を用いて、モデル出力の信頼度を補正することで、予測の信頼性を向上させること。
- テストデータの分布が学習分布から著しく逸脱した場合でも、有効に機能する補正手法を開発すること。
- 最小限のラベル付きデータで、新しい未観測のOODデータセットへの補正モデルの効率的転送を可能にすること。
- 補正モデルの自由パラメータ数を減らしつつ、OODデータにおける高い性能を維持すること。
提案手法
- CCACは、補正ヘッドに補助クラスを導入し、誤分類されたサンプルを信頼度推定プロセス内で正しく分類された予測とは明確に分離する。
- 本手法は、ターゲットDNNのログティット出力を入力とし、19クラスのソフトマックス出力(元の18クラス + 1つの誤分類クラス)を生成する軽量な2層ニューラルネットワークを用いる。
- 簡素化されたバージョンであるCCAC-Sは、正しく分類されたクラスのログティットに対しては1つの温度スケーリングパラメータを用い、誤分類クラスに対しては小さなニューラルネットワークを適用することでパラメータ数を削減する。
- 補正モデルは、検証セット上で交差エントロピーと補正目的をバランスさせるハイパーパramータλ₁とλ₂を用いたハイブリッド損失関数により学習される。
- 転送性は、新しいデータセットからの少量のラベル付きOODサンプルを用いてCCAC-Sをファインチューニングすることで達成され、フルモデルの再学習なしに適応が可能になる。
- 信頼度補正は、期待補正誤差(ECE)、ブライアスコア(BS)、AUROC、AUPR、およびp.9(正解予測の信頼度)といった標準指標を用いて評価される。
実験結果
リサーチクエスチョン
- RQ1post-hoc補正手法が、外分布テストデータに適用された際、深層ニューラルネットワーク分類器の過剰な自信を効果的に低減できるか?
- RQ2誤分類されたサンプルを表す補助クラスを導入することで、OODデータにおける予測信頼度の信頼性が向上するか?
- RQ3簡素化された補正モデル(CCAC-S)は、自由パラメータ数を減らしながらも、優れた汎化性と転送性を維持できるか?
- RQ4CCAC手法は、最小限のラベル付きデータで、新しい未観測のOODデータセットにどれほど効果的に転送できるか?
- RQ5CCACは、多様なOODデータセットにおいて、ECEおよびブライアスコアという観点から、既存のpost-hoc補正手法を一貫して上回るか?
主な発見
- 20 Newsgroups OODデータセットでは、CCACが期待補正誤差(ECE)を3.9%まで低減し、次に良いベースライン(Dirichlet)の8.6%を顕著に上回った。
- CCAC-Sは、OODデータセットでECEを3.0%まで達成し、パラメータ数を減らしたにもかかわらず、最先端の補正性能を維持していることを示した。
- OODデータセットでは、CCACがAUROCを0.861、AUPRを0.894まで向上させ、温度スケーリング(AUROC: 0.855、AUPR: 0.917)を含むすべてのベースラインを上回った。
- 転送モデルであるCCAC-Tは、わずか320個のラベル付きサンプルを用いたファインチューニングで、OODデータセットでECEを4.7%まで達成し、最小限のデータで強い転送性を示した。
- 信頼度図と信頼度ヒストグラムの両方から、CCACは適切に補正された信頼度スコアを生成しており、正解予測は高い信頼度に集中し、誤分類されたサンプルは明確に分離され、低い信頼度が割り当てられていることが確認された。
- D1データセット(内分布)では、CCACがECE 2.4%、ブライアスコア 0.125を達成し、すべてのベースラインを上回る強力な性能を示した。内分布データでも一貫した改善が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。