Skip to main content
QUICK REVIEW

[論文レビュー] Positive-Unlabeled Learning using Random Forests via Recursive Greedy Risk Minimization

Jonathan Wilton, Abigail Koay|arXiv (Cornell University)|Oct 16, 2022
Machine Learning and Data Classification被引用数 9
ひとこと要約

この論文では、決定木学習を再帰的グリーディリスク最小化として定式化することで、正例-未ラベル(PU)学習のための新しいランダムフォレストアルゴリズムPU Extra Treesを提案する。PU固有のリスク推定子(非負のPUリスクなど)を直接最小化することで、最小限のハイパーパrameterチューニングで優れた性能を達成し、リスク低減への各特徴量の寄与度を定量化する特徴量重要度スコアを導入。複数のデータセットにおいて最先端の手法を上回る性能を示した。

ABSTRACT

The need to learn from positive and unlabeled data, or PU learning, arises in many applications and has attracted increasing interest. While random forests are known to perform well on many tasks with positive and negative data, recent PU algorithms are generally based on deep neural networks, and the potential of tree-based PU learning is under-explored. In this paper, we propose new random forest algorithms for PU-learning. Key to our approach is a new interpretation of decision tree algorithms for positive and negative data as \emph{recursive greedy risk minimization algorithms}. We extend this perspective to the PU setting to develop new decision tree learning algorithms that directly minimizes PU-data based estimators for the expected risk. This allows us to develop an efficient PU random forest algorithm, PU extra trees. Our approach features three desirable properties: it is robust to the choice of the loss function in the sense that various loss functions lead to the same decision trees; it requires little hyperparameter tuning as compared to neural network based PU learning; it supports a feature importance that directly measures a feature's contribution to risk minimization. Our algorithms demonstrate strong performance on several datasets. Our code is available at \url{https://github.com/puetpaper/PUExtraTrees}.

研究の動機と目的

  • 深層学習アプローチに比べてあまり検討が進んでいない木ベースのモデルがPU学習に与える潜在的価値を解明すること。
  • 不純度に基づく分割をリスク最小化として解釈することで、PUデータに直接適用可能な決定木学習の原理的フレームワークを構築すること。
  • このフレームワークをランダムフォレストに拡張し、最小限のハイパーパrameterチューニングで効率的なPU学習アルゴリズムを構築すること。
  • PU設定における期待リスクの最小化に寄与する各特徴量の寄与度を直接反映する新しい特徴量重要度スコアを導入すること。
  • 木ベースのPU学習が、最先端のニューラルネットワークベースのPU手法と同等の性能を達成できることを実証すること。

提案手法

  • 標準的な不純度に基づく決定木学習を、特定の損失関数を用いた経験的リスク最小化として再解釈する再帰的グリーディリスク最小化フレームワークを提案。
  • 非負のPUリスク(nnPU)に基づくリスク推定子を設計することで、PU学習に拡張し、PUデータ上で期待リスクを直接最小化可能にする。
  • 不純度低減ではなく、PUリスクの低減が最大になる分割を選択する新しい決定木アルゴリズムを開発。損失関数として二乗損失やロジスティック損失を用いる。
  • ブートストラップサンプリングと特徴量部分集合抽出を用いて複数のPU決定木を組み合わせることで、ランダムフォレストの変種PU Extra Treesを構築。これにより、ロバストネスと一般化性能が向上。
  • 全体のリスク低減への寄与度を定量化するリスク低減ベースの特徴量重要度スコアを導入。
  • リスク低減のしきい値または最大木サイズに基づく停止基準を採用。ヒューリスティックな過学習制御の代わりに、原理的かつ整合性のある代替手段を提供。

実験結果

リサーチクエスチョン

  • RQ1正例-負例および正例-未ラベルデータの両方において、決定木学習を再帰的グリーディリスク最小化として再解釈できるか?
  • RQ2PU固有のリスク推定子を直接最小化することで、従来の不純度ベースの分割に比べて、PU学習でより優れた性能が得られるか?
  • RQ3木ベースのPU学習手法が、顕著に少ないハイパーパrameterチューニングで最先端の深層学習モデルと同等の性能を達成できるか?
  • RQ4提案されたリスクベースの特徴量重要度スコアは、PU設定において標準的な重要度指標よりも解釈可能で意味のあるものか?
  • RQ5提案手法は異なる損失関数に対してどれほどロバストか?多様なデータセットにおいて一貫した性能を維持できるか?

主な発見

  • PU Extra Treesは、UNSW-NB15やMNISTを含む複数のベンチマークデータセットで最先端の性能を達成し、AUCと正答率の両面で競争力のあるスコアを示した。
  • UNSW-NB15データセットでは、AUCが85.65(0.59)を達成し、AUCおよびF1スコアの両面で他のPUおよびPNベースラインを上回った。
  • 提案されたリスク低減ベースの特徴量重要度スコアは、標準的なPNランダムフォレストのものと視覚的・定性的に類似しており、PUモデルが同等で意味のある表現を学習していることを示唆した。
  • 損失関数の選択に対して高いロバストネスを示した:二乗損失やロジスティック損失を用いても同一の決定木が得られ、モデル構造の安定性が裏付けられた。
  • ニューラルネットワークベースのPU手法に比べ、最小限のハイパーパrameterチューニングで済むため、実世界の展開においてより実用的であることが示された。
  • 特徴量重要度スコアは直感的なパターンと整合していた(例:MNISTでは、高重要度のピクセルが数字の形状に対応)。これにより、解釈可能性と関連性が妥当であることが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。