Skip to main content
QUICK REVIEW

[論文レビュー] Confidence Estimation Using Unlabeled Data

Li Chen, Xiaoling Hu|arXiv (Cornell University)|Jul 19, 2023
Adversarial Robustness in Machine LearningComputer Science被引用数 3
ひとこと要約

この論文は、複数のビジョンベンチマークにおいて、ラベルなしデータを活用してモデルの不確実性のキャリブレーションを向上させる、新しい信頼度推定手法を提案する。対照的学習の目的関数を用いてラベルなしデータ上で信頼度ヘッドを訓練することで、ECE、AURC、FPR-95といった不確実性キャリブレーションの指標において、MCドロップアウトやCRLを含む既存の手法を著しく上回り、ラベル付きデータが限られた状況でも優れた性能を発揮する。

ABSTRACT

Overconfidence is a common issue for deep neural networks, limiting their deployment in real-world applications. To better estimate confidence, existing methods mostly focus on fully-supervised scenarios and rely on training labels. In this paper, we propose the first confidence estimation method for a semi-supervised setting, when most training labels are unavailable. We stipulate that even with limited training labels, we can still reasonably approximate the confidence of model on unlabeled samples by inspecting the prediction consistency through the training process. We use training consistency as a surrogate function and propose a consistency ranking loss for confidence estimation. On both image classification and segmentation tasks, our method achieves state-of-the-art performances in confidence estimation. Furthermore, we show the benefit of the proposed method through a downstream active learning task. The code is available at https://github.com/TopoXLab/consistency-ranking-loss

研究の動機と目的

  • 限られたラベル付きデータを用いた深層ニューラルネットワークにおける不確実性推定の改善を目的とする。
  • 低データ環境下で標準的なソフトマックスおよびモンテカルロ法のキャリブレーションの悪さを是正することを目的とする。
  • 追加のアノテーションを必要とせず、ラベルなしデータを効果的に活用して信頼度ヘッドを訓練する手法の開発を目的とする。
  • ECE、AURC、FPR-95といった不確実性推定誤差指標の低減を目的とする。
  • 2.5Kから50Kのラベル付きサンプルまで、さまざまなデータ環境においても安定した性能を発揮することを目的とする。

提案手法

  • ラベルなしデータ上で対照的学習の目的関数を用いて信頼度ヘッドを訓練し、予測値を真の信頼度パターンと一致させる。
  • 訓練の安定化と特徴表現品質の向上のため、モーメンタムエンコーダーを用いる。
  • モデルの予測と、ラベルなしデータから導出された信頼度ターゲットとの間に、温度調整付き交差エントロピー損失を適用する。
  • ラベルなしデータを活用して、データ分布のシフトに対しても一般化可能な信頼度予測子を学習する。
  • 推論時における信頼度ヘッドの統合により、再訓練なしに予測の不確実性を推定する。
  • 意味のある不確実性表現を学習するために、自己教師付きの対照的学習目的を用いる。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしデータを効果的に活用して、不確実性キャリブレーションを向上させる信頼度推定器を訓練できるか?
  • RQ2本手法は、ソフトマックス、MCドロップアウト、AESといった標準的なベースラインと比べて、低データ環境下でどのように性能を発揮するか?
  • RQ3本手法は、データセットのサイズやクラス数(例:CIFAR-10対CIFAR-100)の違いに対しても、性能の向上を維持できるか?
  • RQ4対照的学習の目的関数は、教師あり学習のみに依存する手法に比べて、信頼度推定をどの程度改善するか?
  • RQ5データが限られた状況下で、ECE、AURC、FPR-95といった主要な不確実性指標において、本手法はどのように性能を発揮するか?

主な発見

  • CIFAR-10で2.5Kのラベル付きサンプルを使用した場合、本手法はECEが5.77 ± 0.30を達成し、ソフトマックス(20.23 ± 0.76)やAES(16.82 ± 0.47)を著しく下回った。
  • CIFAR-10で5Kのラベル付きサンプルを使用した場合、本手法はAURCを44.43 ± 1.03まで低減し、ソフトマックス(60.54 ± 1.45)やCRL(51.76 ± 1.91)を上回った。
  • CIFAR-10で10Kのラベル付きサンプルを使用した場合、本手法はFPR-95を59.23 ± 1.96まで低減し、CRL(61.63 ± 1.36)を含むすべてのベースラインを上回った。
  • CIFAR-10の全データ(50K)を使用した場合、本手法はECE(0.86 ± 0.07)とAURC(5.83 ± 0.25)を最低水準に抑え、最良のベースライン(AES)をも上回った。
  • CIFAR-100で10Kのラベル付きサンプルを使用した場合、本手法はECEを14.34 ± 0.32まで低減し、CRL(20.71 ± 0.31)やMcdrop(30.58 ± 0.73)を下回った。
  • CIFAR-100の全データを使用した場合、本手法はECE(7.87 ± 0.18)とブライアスコア(31.52 ± 0.35)を最低水準に抑え、CRLやAESを含むすべてのベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。