Skip to main content
QUICK REVIEW

[論文レビュー] A bagging SVM to learn from positive and unlabeled examples

Fantine Mordelet, Jean‐Philippe Vert|arXiv (Cornell University)|Oct 5, 2010
Machine Learning and Data Classification参考文献 19被引用数 8
ひとこと要約

本稿では、正例と不確実例(PU)学習のための新しい手法であるBagging SVMを提案する。この手法は、不確実データのランダムな部分集合を用いて複数のSVMを訓練し、それらをアンサンブルすることで分類器の安定性を向上させる。既存のPU手法と同等またはそれを上回る性能を発揮するとともに、特に正例の数に比べて不確実例の数が著しく多い場合に顕著に高速である。

ABSTRACT

We consider the problem of learning a binary classifier from a training set of positive and unlabeled examples, both in the inductive and in the transductive setting. This problem, often referred to as \emph{PU learning}, differs from the standard supervised classification problem by the lack of negative examples in the training set. It corresponds to an ubiquitous situation in many applications such as information retrieval or gene ranking, when we have identified a set of data of interest sharing a particular property, and we wish to automatically retrieve additional data sharing the same property among a large and easily available pool of unlabeled data. We propose a conceptually simple method, akin to bagging, to approach both inductive and transductive PU learning problems, by converting them into series of supervised binary classification problems discriminating the known positive examples from random subsamples of the unlabeled set. We empirically demonstrate the relevance of the method on simulated and real data, where it performs at least as well as existing methods while being faster.

研究の動機と目的

  • 情報検索や遺伝子ランク付けにおいて一般的に見られる、正例と不確実例しか入手できない状況における二値分類器の学習という課題に取り組む。
  • 不確実データの汚染率が変動する状況において、標準的なPU学習手法が示す不安定性を、アンサンブル手法を活用することで克服する。
  • バイアス付きSVMの代替として計算効率の高い手法を開発し、高い性能を維持しながら学習時間を短縮する。
  • シミュレート済みおよび実世界のデータセットを用いて、誘導的および転送的設定の両方で手法を評価し、安定性とスケーラビリティを検証する。

提案手法

  • 既知の正例をランダムな不確実データ部分集合から区別する複数のSVMを訓練する、バギングに類似したフレームワークを提案する。
  • 個々の分類器のバイアスと分散のバランスを取るために、不確実データ部分集合のサイズKを制御し、K = |P|をデフォルトとして採用する。
  • T個の個別SVMの予測を統合して最終的なスコア関数を形成し、安定性と一般化性能を向上させる。
  • 予測を不確実データセット内に限定することで、転送的PU学習にこの手法を適応する。
  • 各ベース分類器を正例のバランスの取れた部分集合と、不確実データのランダム部分集合を用いて訓練する、対称的なバギング戦略を採用する。
  • 反復的リウェイトや複雑な最適化を必要とせず、ベースモデルの単純なアンサンブル平均に依存する。

実験結果

リサーチクエスチョン

  • RQ1バギングによるアンサンブル学習は、漸近的でない設定において、PU学習の安定性と性能を向上させ得るか?
  • RQ2ランダムな不確実データ部分集合のサイズKが、最終的な分類器の性能と計算コストにどのように影響するか?
  • RQ3Bagging SVMは、精度と速度の両面で、バイアス付きSVMを含む最先端のPU学習手法を上回るか、同等の性能を発揮するか?
  • RQ4正例が僅かにしか存在しないような状況では、PU学習が一クラスSVMを上回る場面はどのようなものか?
  • RQ5|U| >> |P| のような状況において、Bagging SVMがバイアス付きSVMよりも顕著に高速になる条件は何か?

主な発見

  • シミュレーションデータにおいて、Bagging SVMはバイアス付きSVMと同等またはそれ以上の性能を発揮し、実データでは有意差が認められない。
  • 20 Newsgroupsデータセットでは、T=35、K=10のBagging SVMがAUC 0.921、AUP 0.531を達成したのに対し、バイアス付きSVMは227秒でAUC=0.932、AUP=0.491を記録した。
  • T=200、K=200の設定では、Bagging SVMは473秒を要したが、バイアス付きSVMは227秒で終了し、|U|/|P| > 6 の場合にBagging SVMが高速であることが示された。
  • Kの変動に対して本手法は安定しており、K = |P|は性能と計算負荷の両立を図る安全なデフォルト選択肢として浮き彫りになった。
  • 正例が10個未満の状況では、一クラスSVMが20 NewsgroupsベンチマークでPU手法を上回った。これは、PU学習が常に優れているわけではないことを示唆している。
  • 計算上の利点は、|U|/|P| の比が大きくなるほど拡大し、不確実例が正例に比べて著しく多い大規模応用において特に効率的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。