Skip to main content
QUICK REVIEW

[論文レビュー] A Flexible and Adaptive Framework for Abstention Under Class Imbalance

Avanti Shrikumar, Amr M. Alexandari|arXiv (Cornell University)|Feb 20, 2018
Imbalanced Data Classification Techniques参考文献 37被引用数 7
ひとこと要約

本稿では、AUC や加重コーエンの kappa といった不均衡データの重要な指標を最適化するための、柔軟でメトリクスに配慮した放棄フレームワークを提案する。校正済み確率推定値を用いて、これらの指標に与える放棄の影響をモデル化することで、不均衡なテスト分布に一般化可能な、効率的で適応的な放棄戦略を実現する。ラベルシフト下でのドメイン適応を用いることで実現される。

ABSTRACT

In practical applications of machine learning, it is often desirable to identify and abstain on examples where the model's predictions are likely to be incorrect. Much of the prior work on this topic focused on out-of-distribution detection or performance metrics such as top-k accuracy. Comparatively little attention was given to metrics such as area-under-the-curve or Cohen's Kappa, which are extremely relevant for imbalanced datasets. Abstention strategies aimed at top-k accuracy can produce poor results on these metrics when applied to imbalanced datasets, even when all examples are in-distribution. We propose a framework to address this gap. Our framework leverages the insight that calibrated probability estimates can be used as a proxy for the true class labels, thereby allowing us to estimate the change in an arbitrary metric if an example were abstained on. Using this framework, we derive computationally efficient metric-specific abstention algorithms for optimizing the sensitivity at a target specificity level, the area under the ROC, and the weighted Cohen's Kappa. Because our method relies only on calibrated probability estimates, we further show that by leveraging recent work on domain adaptation under label shift, we can generalize to test-set distributions that may have a different class imbalance compared to the training set distribution. On various experiments involving medical imaging, natural language processing, computer vision and genomics, we demonstrate the effectiveness of our approach. Source code available at this https URL. Colab notebooks reproducing results available at this https URL.

研究の動機と目的

  • 不均衡データセットにおける極めて重要な指標である AUC およびコーエンの kappa を最適化する放棄戦略の欠落を埋める。
  • 再訓練や推論時における真のラベルのアクセスを必要としない、メトリクス固有の放棄を可能にするフレームワークの開発。
  • ラベルシフト適応を用いて、学習データとは異なるクラス不均衡を持つテスト分布に対しても一般化可能な放棄ポリシーの実現。
  • 感度を所望の特異度で最適化する、AUC、加重コーエンの kappa を含む、さまざまな指標を効率的に最適化するための計算効率の良いアルゴリズムの提供。
  • 医療画像、自然言語処理、コンピュータビジョン、ゲノム研究など多様な分野において、フレームワークの有効性の実証。

提案手法

  • 真のクラスラベルの代理として校正済み確率推定値を用い、例を放棄した場合の指標の期待値変化を推定する。
  • 放棄による期待される指標改善をモデル化することで、AUC や加重 kappa、固定特異度における感度の最適化を可能にする、メトリクス固有の放棄ポリシーを策定する。
  • 指標変化の微分可能近似を用いて、各指標のための効率的で閉形式の放棄しきい値を導出する。
  • ラベルシフト下でのドメイン適応技術を統合し、学習時とは異なるクラス分布を持つテストセットに対しても放棄ポリシーを適応可能にする。
  • 推論時に指標推定に信頼性のある代理推定値を提供するため、モデルが校正済み確率を出力するように訓練する。
  • 推論時に真のラベルにアクセスする必要がなく、予測確率のみに依存するエンドツーエンドのフレームワーク適用。

実験結果

リサーチクエスチョン

  • RQ1AUC や加重コーエンの kappa を最適化する放棄戦略は、不均衡データ環境下でトップ-k正答率に基づく手法を上回る性能を示すか?
  • RQ2さまざまな性能指標に適応可能な放棄を維持しつつ、計算効率を保てるか?
  • RQ3一貫した放棄フレームワークが、学習データとは異なるクラス不均衡を持つさまざまなテスト分布にどれほど一般化できるか?
  • RQ4真のラベルが入手不可な状況下でも、校正済み確率が放棄による指標変化を信頼性高く推定できるか?
  • RQ5提案フレームワークは、多様な機械学習分野における既存の放棄手法と比較して、どのように優れているか?

主な発見

  • 提案フレームワークは、トップ-k正答率に基づく放棄戦略と比較して、不均衡データセットにおける AUC および加重コーエンの kappa の向上を顕著に実現した。
  • ラベルシフト適応のおかげで、学習時とは異なるクラス分布を持つテストセットに対しても、効果的に一般化された。
  • AUC や加重 kappa に最適化された放棄ポリシーは、すべての例がインデータ分布内にあろうとも、ベースライン手法を上回る指標値を達成した。
  • フレームワークは高い計算効率を維持しており、校正済みモデル出力のみでリアルタイムの放棄意思決定が可能である。
  • 医療画像、自然言語処理、コンピュータビジョン、ゲノム研究における実験から、多様なデータモダリティにおいて一貫した性能向上が確認された。
  • ソースコードおよび Colab ノートブックは公開されており、再現性とフレームワークの拡張が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。