Skip to main content
QUICK REVIEW

[論文レビュー] Feature Ranking for Semi-supervised Learning

Matej Petković, Sašo Džeroski|arXiv (Cornell University)|Aug 10, 2020
Computational Drug Discovery Methods被引用数 5
ひとこと要約

本論文は、木アンサンブルとリリーフベースのアルゴリズムを用いて、分類、回帰、構造化出力予測(マルチラベル、階層的マルチラベル、マルチターゲットタスク)のための半教師付き特徴量ランク付けを提案する。実験では、ほとんどのベンチマークデータセットにおいて、ラベルなしデータを組み込むことで特徴量ランク付けの性能が向上することを示しており、ランダムフォレストが最も効率が良く、半教師付きランク付けが大多数のケースで教師ありの対応手法を上回ることを確認した。

ABSTRACT

The data made available for analysis are becoming more and more complex along several directions: high dimensionality, number of examples and the amount of labels per example. This poses a variety of challenges for the existing machine learning methods: coping with dataset with a large number of examples that are described in a high-dimensional space and not all examples have labels provided. For example, when investigating the toxicity of chemical compounds there are a lot of compounds available, that can be described with information rich high-dimensional representations, but not all of the compounds have information on their toxicity. To address these challenges, we propose semi-supervised learning of feature ranking. The feature rankings are learned in the context of classification and regression as well as in the context of structured output prediction (multi-label classification, hierarchical multi-label classification and multi-target regression). To the best of our knowledge, this is the first work that treats the task of feature ranking within the semi-supervised structured output prediction context. More specifically, we propose two approaches that are based on tree ensembles and the Relief family of algorithms. The extensive evaluation across 38 benchmark datasets reveals the following: Random Forests perform the best for the classification-like tasks, while for the regression-like tasks Extra-PCTs perform the best, Random Forests are the most efficient method considering induction times across all tasks, and semi-supervised feature rankings outperform their supervised counterpart across a majority of the datasets from the different tasks.

研究の動機と目的

  • 機械学習における高次元で部分的にラベルが付与されたデータの課題に対処するため、半教師付き特徴量ランク付け手法を開発すること。
  • マルチラベル、階層的マルチラベル、マルチターゲット回帰を含む、構造化出力予測タスクへの特徴量ランク付けの拡張を図ること。
  • 完全に教師ありのアプローチと比較して、ラベルなしデータを活用することで特徴量ランク付けのパフォーマンスが向上するかを評価すること。
  • 多様な学習タスクにおいて、異なるアンサンブル法およびリリーフベースの手法の有効性と効率性を比較すること。

提案手法

  • 木アンサンブル(ランダムフォレスト、エキストラツリー、バギング)を用いた3つのスコア関数(Genie3、シンボリック、ランダムフォレストスコア)を組み合わせた2つの半教師付き特徴量ランク付けアプローチを提案する。
  • リリーフ族アルゴリズムを構造化出力予測タスクに拡張することで、半教師付き学習に適応させる。
  • クラスタリング仮説を用いてラベルなしデータを活用し、データのクラスタがターゲット値の分布を反映すると仮定する。
  • 単一ターゲットおよびマルチターゲット予測タスク(階層的・マルチラベル出力含む)を統一したフレームワークで処理する。
  • すべての手法をJavaで実装されたClusシステムに統合し、最近接探索の処理にはscikit-learnを用いたPythonでのラプラシアンスコアを実装する。
  • 5つのタスク(分類、マルチラベル、階層的マルチラベル、回帰、マルチターゲット回帰)の38のベンチマークデータセットを用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1分類タスク(分類、マルチラベル、階層的マルチラベル分類)において、ランダムフォレスト、エキストラツリー、バギングのうち、どのアンサンブル手法が最も優れた特徴量ランク付け性能を達成するか?
  • RQ2性能と一般化能力の観点から、半教師付き特徴量ランク付けは教師ありの対応手法と比べてどのように差がつくか?
  • RQ3構造化出力予測タスクにおいて、ラベルなしデータの活用が特徴量ランク付けの品質向上に寄与するか?
  • RQ4分類、回帰、マルチターゲットなど、各学習タスクの種別において、どの特徴量ランク付けアルゴリズムが最も優れているか?
  • RQ5誘導時間(induction time)の観点から、異なる半教師付き特徴量ランク付け手法の計算効率はどのようになるか?

主な発見

  • ランダムフォレストは、分類に近いタスク(分類、マルチラベル、階層的マルチラベル分類)において、常に他のアンサンブル手法を上回り、これらのタスクで平均的に最高のランク付け性能を達成した。
  • 回帰に近いタスク(回帰およびマルチターゲット回帰)では、エキストラ-PCTsが最良のパフォーマンスを示し、特にシンボリックスコア関数がこれらの設定で最も優れた性能を発揮した。
  • ランダムフォレストは、全タスクにおいて最も効率が良く、誘導時間が最も速く、次いでエキストラツリー、バギングの順に高速であった。
  • 半教師付き特徴量ランク付けは、全5タスクの大多数のデータセットで教師ありの対応手法を上回り、ラベルなしデータが特徴量の関連性推定を改善することを示している。
  • 標準的な分類タスクではリリーフベースの手法が最良の性能を示したが、階層的マルチラベル分類ではGenie3ベースのランク付けが最適であった。
  • ラプラシアンスコアは、k-NNの最適化されたscikit-learn実装のおかげで、リリーフと同等の計算量でありながら最も速い誘導時間を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。