Skip to main content
QUICK REVIEW

[論文レビュー] Recovering True Classifier Performance in Positive-Unlabeled Learning

Shantanu Jain, Martha White|arXiv (Cornell University)|Feb 2, 2017
Machine Learning and Data Classification被引用数 5
ひとこと要約

本稿では、クラス事前確率とノイズ割合を活用することで、正例-未ラベル(PU)学習で訓練された分類器のバイアスのかかった性能推定値を補正する手法を提案する。ROC曲線および精度再現率曲線の閉形式補正を導出し、補正済み推定値が通常のPU評価と比較して顕著に優れていることを示している。通常のPU評価は真の性能を低く見積もる傾向がある。

ABSTRACT

A common approach in positive-unlabeled learning is to train a classification model between labeled and unlabeled data. This strategy is in fact known to give an optimal classifier under mild conditions; however, it results in biased empirical estimates of the classifier performance. In this work, we show that the typically used performance measures such as the receiver operating characteristic curve, or the precision-recall curve obtained on such data can be corrected with the knowledge of class priors; i.e., the proportions of the positive and negative examples in the unlabeled data. We extend the results to a noisy setting where some of the examples labeled positive are in fact negative and show that the correction also requires the knowledge of the proportion of noisy examples in the labeled positives. Using state-of-the-art algorithms to estimate the positive class prior and the proportion of noise, we experimentally evaluate two correction approaches and demonstrate their efficacy on real-life data.

研究の動機と目的

  • 正例と未ラベルデータから学習された分類器の性能評価におけるバイアスを是正すること。ここで未ラベルデータは負例として扱われる。
  • クラス事前確率とノイズ割合を用いて、従来の(真の)性能とPUで推定された性能との関係を形式化すること。
  • PU設定下で真の分類器性能を回復できる、ROC曲線および精度再現率曲線の実用的補正手法を開発すること。
  • 実世界のデータセットと最先端の事前確率推定技術を用いて、直接的および間接的補正アプローチの有効性を評価すること。
  • 解釈可能性と信頼性を向上させるために、生のPU性能と補正済み性能の両方を報告することを提唱すること。

提案手法

  • 正例クラス事前確率 α とノイズ割合 β を用いて、従来設定における受信者応答特性曲線下積分(AUC)とPU設定で推定されたAUCとの間の閉形式解析的関係を導出する。
  • 同じクラス事前確率とノイズ割合推定値を組み込むことで、補正フレームワークを精度再現率曲線へ拡張する。
  • 2つの補正戦略を提案する:推定された α と β を直接用いる直接法、および非従来型分類器の経験的ROC曲線を利用する間接法。
  • AlphaMax や相互不可削減性に基づく推定法などの最先端のアルゴリズムを用いて、PUデータから α と β を推定する。
  • 多様な実世界データセットを用いて補正性能を検証し、補正済み推定値を保持されたラベル付きデータに対する真値評価と比較する。
  • 弱い分布的仮定のもとでクラス事前確率とノイズ割合の同定可能性を保証するため、不可削減性制約を用いる。

実験結果

リサーチクエスチョン

  • RQ1推定されたクラス事前確率とノイズ割合のみを用いて、正例-未ラベル設定で学習された分類器の真の性能を回復できるか?
  • RQ2補正済みROC曲線および精度再現率曲線は、標準的なPU推定曲線と比較してどの程度精度が高いか?
  • RQ3実際の応用において、直接法と間接法のどちらの補正戦略がより信頼性の高い性能推定をもたらすか?
  • RQ4ラベル付き正例に誤検出(偽陽性)が含まれる状況において、ノイズ割合推定を組み込むことで性能回復がどの程度向上するか?
  • RQ5真の性能が不明な実世界のPU学習問題に、これらの補正を適用することは可能で実用的か?

主な発見

  • 提案された補正手法は、常に真の分類器性能を低く見積もる標準的なPU評価と比較して一貫して優れていた。
  • 非従来型分類器の経験的ROC曲線に基づく間接補正法は、評価されたすべてのデータセットで直接法よりも高い精度を達成した。
  • 補正済みAUC推定値は、代表的なラベル付きテストセットで計算された真のAUCに顕著に近づき、クラス事前確率とノイズ割合の組み込みが有効であることを示した。
  • ラベル付き正例に偽陽性が含まれる状況においても、ノイズ割合推定の組み込みが性能回復を改善し、本手法のラベルノイズに対するロバストネスを裏付けた。
  • 多様な実世界データセットにおける実験的結果から、直接法および間接法の両方の補正アプローチがPU学習における性能推定において実現可能で実用的であることが確認された。
  • 本研究では、生のPU性能と補正済み性能の両方を報告することで、分類器の挙動をより包括的かつ正確に把握できると示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。