Skip to main content
QUICK REVIEW

[論文レビュー] Classification from Positive, Unlabeled and Biased Negative Data

Yu-Guan Hsieh, Gang Niu|arXiv (Cornell University)|Oct 1, 2018
Machine Learning and Data Classification参考文献 47被引用数 10
ひとこと要約

本稿では、インスタンス依存の例の重み付けを用いた経験的リスク最小化により、正例(P)、未ラベル例(U)、および偏りのある負例(bN)データを統合することで、二値分類の性能を向上させる、新しいPUbN(Positive-Unlabeled-Biased Negative)学習フレームワークを提案する。この手法はPU学習ベンチマークで最先端の性能を達成し、サンプリング確率推定に基づく2段階の重み付け戦略により、代表的でない負例データを効果的に活用することで一般化性能を著しく向上させる。

ABSTRACT

In binary classification, there are situations where negative (N) data are too diverse to be fully labeled and we often resort to positive-unlabeled (PU) learning in these scenarios. However, collecting a non-representative N set that contains only a small portion of all possible N data can often be much easier in practice. This paper studies a novel classification framework which incorporates such biased N (bN) data in PU learning. We provide a method based on empirical risk minimization to address this PUbN classification problem. Our approach can be regarded as a novel example-weighting algorithm, with the weight of each example computed through a preliminary step that draws inspiration from PU learning. We also derive an estimation error bound for the proposed method. Experimental results demonstrate the effectiveness of our algorithm in not only PUbN learning scenarios but also ordinary PU learning scenarios on several benchmark datasets.

研究の動機と目的

  • 真の負例分布とは代表的でない偏りのある負例(bN)データを含む正例(P)、未ラベル例(U)、およびbNデータから学習する課題に対処すること。
  • 完全に代表的な負例データが収集可能でない状況においても、bNデータを統合することで従来のPU学習を拡張し、分類器の性能を向上させること。
  • タスク固有の類似度測定や仮定に依存しない汎用的かつドメインに依存しない手法を開発すること。
  • PUbN設定下での提案されたリスク推定器の推定誤差を理論的に分析すること。
  • 提案手法が標準的なPU学習とベースライン手法に対して、ベンチマークデータセット上で優れていることを経験的に検証すること。

提案手法

  • 本手法は、P、U、bNデータを重み付き例として扱い、サンプリングバイアスを補正する経験的リスク最小化(ERM)を用いて分類器を学習する。
  • PおよびbNデータに基づいて事前モデルを学習し、各例がPまたはbN集合に抽出される確率を推定する。
  • この推定に基づき、各例に重みを割り当てる:U例はPまたはbNに属しにくい場合に高い重みが与えられる。P例は負例として扱われるため、小またはゼロの重みが割り当てられる。
  • 分類器は、PU学習の原則と重要度重み付けを組み合わせたリスク推定器を用いて学習される。これにより、負例データのバイアスを補正する。
  • 2段階のアルゴリズムとして実装される:まずサンプリング確率を推定し、次にインスタンス依存の重みを用いて分類器を訓練する。
  • bN集合を空集合に設定することで、標準的なPU学習に適応可能であり、nnPUなどの既存の最先端手法よりも優れた性能を達成する。

実験結果

リサーチクエスチョン

  • RQ1標準的なPU学習と比較して、bNデータをPU学習に統合することで分類性能が向上するか?
  • RQ2完全な負例分布へのアクセスなしに、P、U、bN集合のみを用いてbNデータのサンプリングバイアスをどのように是正できるか?
  • RQ3PUbN学習フレームワーク下での提案されたリスク推定器の推定誤差の境界は何か?
  • RQ4bNデータが利用できない場合、標準的なPU学習タスクに本手法がどれほど一般化できるか?
  • RQ5本手法がnnPUやuPUといった既存のPU学習ベースラインを、誤検出率および誤検出率の観点で上回る理由は何か?

主な発見

  • 提案されたPUbN手法は、複数のPU学習ベンチマークで最先端の性能を達成し、既存の最先端手法であるnnPUを上回る。
  • MNISTおよびCIFAR-10で車両を正例クラスとして用いた場合、PUbN extbackslash{}NはuPUおよびnnPUの両方よりも低い誤分類誤差を達成し、uPUと同等の誤検出率、nnPUよりも低い誤検出率を示した。
  • 主成分分析(PCA)による可視化では、学習された特徴空間で正例(例:数字1, 3, 5)が負例クラスから明確に分離されていることが示され、分類器のクラス識別性能が向上していることが裏付けられた。
  • bNデータの使用により、分類器の一般化性能が著しく向上し、誤検出率が低減し、複数のランダムシードにわたって安定した性能を示した。
  • 理論的分析により、PUbN仮定下で提案されたリスク推定器の推定誤差の境界が確立され、統計的一貫性が裏付けられた。
  • 本手法はロバストで汎用的である:bNデータを省略して標準的なPU学習に適用した場合でも、nnPUを上回る優れた性能を達成しており、より広範な適用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。