Skip to main content
QUICK REVIEW

[論文レビュー] Improving Positive Unlabeled Learning: Practical AUL Estimation and New Training Method for Extremely Imbalanced Data Sets

Liwei Jiang, Dan Li|arXiv (Cornell University)|Apr 21, 2020
Imbalanced Data Classification Techniques参考文献 28被引用数 7
ひとこと要約

本稿では、ラベルなしサンプルの事前知識を必要とせず、実用的なAUL推定手法を提案するとともに、極端に不均衡なPUデータセット向けの新しい学習手法ProbTaggingを導入する。ProbTaggingは、ラベルなしサンプルを既知の正例サンプルとの類似度に基づいて確率的ラベル付けすることで、複数の合成PNデータセットを生成し、それら上でアンサンブルモデルを学習する。実際の産業界および人工PUデータセットにおいて、最先端手法に比べて最大10%のAUC向上を達成した。

ABSTRACT

Positive Unlabeled (PU) learning is widely used in many applications, where a binary classifier is trained on the datasets consisting of only positive and unlabeled samples. In this paper, we improve PU learning over state-of-the-art from two aspects. Firstly, existing model evaluation methods for PU learning requires ground truth of unlabeled samples, which is unlikely to be obtained in practice. In order to release this restriction, we propose an asymptotic unbiased practical AUL (area under the lift) estimation method, which makes use of raw PU data without prior knowledge of unlabeled samples. Secondly, we propose ProbTagging, a new training method for extremely imbalanced data sets, where the number of unlabeled samples is hundreds or thousands of times that of positive samples. ProbTagging introduces probability into the aggregation method. Specifically, each unlabeled sample is tagged positive or negative with the probability calculated based on the similarity to its positive neighbors. Based on this, multiple data sets are generated to train different models, which are then combined into an ensemble model. Compared to state-of-the-art work, the experimental results show that ProbTagging can increase the AUC by up to 10%, based on three industrial and two artificial PU data sets.

研究の動機と目的

  • ラベルなしサンプルに真のラベルが存在しないことによる、PU学習における信頼性の高いモデル評価の欠如に対処すること。
  • 正例がラベルなしサンプルに比べて極めて少ない、極端なクラス不均衡下でのPU学習のパフォーマンスを向上させること。
  • 負例ラベルのラベル付けを必要とせず、データ効率性とモデルの頑健性を向上させる学習手法を開発すること。
  • クラス事前分布の知識やPNテストセットに依存せずに、生PUデータのみを用いて、偏りのない評価指標AULを提供すること。

提案手法

  • クラス事前分布の知識やラベルなしサンプルの真のラベルを必要とせず、生PUデータのみを用いて漸近的に不偏なAUL推定を行う手法を提案する。
  • 既知の正例サンプルとの類似度に基づいて、ラベルなしサンプルに確率的正例/負例ラベルを割り当てる学習フレームワークProbTaggingを導入する。
  • k-NNを用いてラベルなしサンプルと正例サンプル間の類似度を計算し、類似度に比例する確率で正例ラベルを割り当てる。
  • 確率的ラベル付けからサンプリングすることで、複数の合成PNデータセットを生成し、多様なベースモデルの学習を可能にする。
  • 合成データセット上で学習された複数のモデルのアンサンブル平均を用いることで、汎化性能と頑健性を向上させる。
  • 実装では、ベース分類器にGBDTを、類似度計算にk-NNを用いる。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしクラスの分布に関する事前知識や真のラベルが存在しない状況下でも、PU学習におけるAULを信頼性高く推定できるか?
  • RQ2PNラベル付きテストセットにアクセスできない状況下で、生PUデータのみを用いてモデル性能を効果的に評価できるか?
  • RQ3正例の有効数を増やすことで、PU学習における極端なクラス不均衡を緩和できるような学習手法を設計できるか?
  • RQ4正例サンプルとの類似度に基づいたラベルなしサンプルの確率的ラベル付けが、モデルの汎化性能とAUCパフォーマンスを向上させるか?
  • RQ5実世界の産業界PUデータセットで一般的な高ノイズおよび低正例率の状況下でも、提案手法は良好な性能を示すか?

主な発見

  • 提案手法のAUL推定は、クラス事前分布の知識がなくても、対応するPNデータ上で計算された真のAUCに対して漸近的に不偏な推定値を提供する。
  • ProbTaggingは、3つの産業界データセットおよび2つの人工PUデータセットにおいて、最先端手法に比べてAUCを最大10%向上させる。
  • θ₀ = 0.5 のAPSおよびクレジットカード不正検知データセットでは、それぞれAUC 0.9921および0.9757を達成し、Elkanの手法およびBaggingPUを上回った。
  • ProbTaggingは高ノイズ(大きな1−θ₀)下でも強固な性能を維持しており、他の手法が著しく劣化する極度に不均衡な状況下でも頑健性を示した。
  • nnPUおよびPU-AUCは、希少な正例サンプルがリスク推定に十分に寄与しないため、極端に不均衡なデータでは劣った性能を示した。
  • ProbTaggingにおけるアンサンブルアプローチは、同一の正例サンプルが使用されるため相関が高いBaggingPUに比べ、分散をより効果的に低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。