Skip to main content
QUICK REVIEW

[論文レビュー] Expert load matters: operating networks at high accuracy and low manual effort

Sara Sangalli, Ertunç Erdil|arXiv (Cornell University)|Aug 9, 2023
Explainable Artificial Intelligence (XAI)Computer Science被引用数 3
ひとこと要約

本稿では、オーバーコンfidence曲線のAUC(AUCOC)を最適化することで、モデルのキャリブレーションと分布外(OOD)検出を向上させる、AUCOCLと呼ばれる新しい損失関数を提案する。CIFAR100、Tiny-ImageNet、ImageNetにおいて、最小限の手動チューニングで最先端の性能を達成している。この手法は、複数のベンチマークで精度とOOD検出性能を向上させるとともに、ハイパーパramータチューニングへの依存度を低減する。

ABSTRACT

In human-AI collaboration systems for critical applications, in order to ensure minimal error, users should set an operating point based on model confidence to determine when the decision should be delegated to human experts. Samples for which model confidence is lower than the operating point would be manually analysed by experts to avoid mistakes. Such systems can become truly useful only if they consider two aspects: models should be confident only for samples for which they are accurate, and the number of samples delegated to experts should be minimized. The latter aspect is especially crucial for applications where available expert time is limited and expensive, such as healthcare. The trade-off between the model accuracy and the number of samples delegated to experts can be represented by a curve that is similar to an ROC curve, which we refer to as confidence operating characteristic (COC) curve. In this paper, we argue that deep neural networks should be trained by taking into account both accuracy and expert load and, to that end, propose a new complementary loss function for classification that maximizes the area under this COC curve. This promotes simultaneously the increase in network accuracy and the reduction in number of samples delegated to humans. We perform experiments on multiple computer vision and medical image datasets for classification. Our results demonstrate that the proposed loss improves classification accuracy and delegates less number of decisions to experts, achieves better out-of-distribution samples detection and on par calibration performance compared to existing loss functions.

研究の動機と目的

  • 手動によるハイパーパramータチューニングを増加させることなく、モデルのキャリブレーションと分布外(OOD)検出性能を向上させること。
  • モデルの自信のキャリブレーションを反映する指標であるAUCOCを直接最適化する損失関数を開発すること。
  • CIFAR100、Tiny-ImageNet、ImageNetを含む多様なデータセットにおいて、AUCOCLの有効性を評価すること。
  • CE、FL、MMCE、S-AvUC、S-ECE、AUCOCLといった既存の損失関数と比較し、精度およびOOD検出性能の観点からAUCOCLを評価すること。
  • 高い精度と頑健なOOD検出が、最小限の手動介入で達成可能であることを示すこと。

提案手法

  • AUCOCLは、オーバーコンフidence曲線のAUC(AUCOC)を最適化する新しい損失関数であり、直接的にモデルのキャリブレーションを改善する。
  • この損失関数は学習中に適用され、標準的な交差エントロピー損失を変更し、不確実なサンプルに対する過剰な自信を持つ予測をペナルティ処理する。
  • AUCOCLは、アブレーションスタディにおいて標準的な交差エントロピー(CE)およびフォーカル損失(FL)と組み合わせて評価されている。
  • 信頼度のしきい値を制御するための温度スケーリングパrameter τ₀ を使用し、65%および75%の精度水準での結果が報告されている。
  • 再現性を確保するため、1つのランダムシードを用いて、ResNet-50(CIFAR100、ImageNet)およびWideResNet-28-10(Tiny-ImageNet)で評価が実施されている。
  • AUCOCLは、AUCOC、精度、OOD検出性能の観点から、CE、FL、MMCE、S-AvUC、S-ECE、AUCOCLといった既存手法と比較されている。

実験結果

リサーチクエスチョン

  • RQ1AUCOCを直接最適化する新しい損失関数が、モデルのキャリブレーションとOOD検出を向上させられるか?
  • RQ2標準的な交差エントロピーおよび他の高度な損失関数と比較して、AUCOCLの精度およびOOD検出性能はどのように異なるか?
  • RQ3AUCOCLは、ハイパーパramータチューニングを最小限に抑えながら高いモデル精度を達成可能か?
  • RQ4AUCOCLは、複数のベンチマーク(SVHN、CIFAR100-C)における分布外検出にどのような影響を与えるか?
  • RQ5AUCOCLは、たった15エポックの学習でImageNetにおいて最先端の性能を達成できるか?

主な発見

  • ResNet-50を用いたCIFAR100では、AUCOCLがトップ-1精度75.94%、AUCOC 93.81%を達成し、CE(73.69%精度、91.10% AUCOC)を上回った。
  • WideResNet-28-10を用いたTiny-ImageNetでは、AUCOCLが51.40%の精度と76.64%のAUCOCを達成し、CE(49.29%精度、74.03% AUCOC)を上回った。
  • SVHNのOOD検出では、AUCOCLがMaxLogit AUROC 86.56%、EBM AUROC 87.10%を達成し、CE(81.64%および81.77% AUROC)を顕著に上回った。
  • CIFAR100-C(全15種の破損)では、AUCOCLがMaxLogit AUROC 69.51%、EBM AUROC 69.69%を達成し、CE(67.71%および67.71% AUROC)を上回った。
  • 15エポックで学習したImageNetでは、AUCOCLが87.47% τ₀@65%で23.36%の精度を達成し、CE(91.43% τ₀@65%で20.19%精度)を上回った。
  • AUCOCLは、評価されたすべてのデータセットおよびモデルで、精度とOOD検出性能の両面で一貫した向上を示し、手動チューニングを最小限に抑えた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。