Skip to main content
QUICK REVIEW

[論文レビュー] An Outlier Detection-based Tree Selection Approach to Extreme Pruning of Random Forests

Khaled Fawagreh, Mohamed Medhat Gaber|arXiv (Cornell University)|Mar 17, 2015
Anomaly Detection Techniques and Applications参考文献 38被引用数 3
ひとこと要約

この論文では、局所外れ値要因(LOF)スコアを用いて予測の多様性が最も高い木のみを選択することで、ランダムフォレストにおける極端なプルーニング手法であるLOFB-DRFを提案する。この手法により、精度を維持または向上させながら最大99%のプルーニングが可能となり、リアルタイム応用に適している。LOFスコアが高く、多様性が大きい木を優先することで、モデルサイズと推論時間を削減しつつ性能を損なわない。

ABSTRACT

Random Forest (RF) is an ensemble classification technique that was developed by Breiman over a decade ago. Compared with other ensemble techniques, it has proved its accuracy and superiority. Many researchers, however, believe that there is still room for enhancing and improving its performance in terms of predictive accuracy. This explains why, over the past decade, there have been many extensions of RF where each extension employed a variety of techniques and strategies to improve certain aspect(s) of RF. Since it has been proven empirically that ensembles tend to yield better results when there is a significant diversity among the constituent models, the objective of this paper is twofolds. First, it investigates how an unsupervised learning technique, namely, Local Outlier Factor (LOF) can be used to identify diverse trees in the RF. Second, trees with the highest LOF scores are then used to produce an extension of RF termed LOFB-DRF that is much smaller in size than RF, and yet performs at least as good as RF, but mostly exhibits higher performance in terms of accuracy. The latter refers to a known technique called ensemble pruning. Experimental results on 10 real datasets prove the superiority of our proposed extension over the traditional RF. Unprecedented pruning levels reaching 99% have been achieved at the time of boosting the predictive accuracy of the ensemble. The notably high pruning level makes the technique a good candidate for real-time applications.

研究の動機と目的

  • 100~500本の木を含む大規模なランダムフォレストの高い計算コストとメモリ使用量を低減し、精度を損なわずアンサンブルサイズを縮小すること。
  • プルーニング後のアンサンブルに残る木の多様性を高めることで、予測性能を向上させること。
  • 効率的かつ効果的なプルーニング戦略を開発し、コンactかつ正確なモデルのリアルタイムデプロイメントを可能にすること。
  • 教師なしの外れ値検出が、アンサンブルプルーニングに適した多様で高性能な木を効果的に同定できるかどうかを調査すること。
  • 多様性に基づく木選択によって、極端なプルーニング(最大99%)が精度を維持または向上させつつ可能かどうかを実証すること。

提案手法

  • 本手法は、トレーニングインスタンス全体における各木の予測の多様性に基づき、局所外れ値要因(LOF)を用いて異常度スコアを計算する。
  • LOFスコアが最も高い木が選択され、これはアンサンブル内での予測が最も多様(「外れ値的」)であることを示している。
  • 最終的なプルーニングモデルであるLOFB-DRFは、これらの高LOFスコアの木のみを用いて多数決投票を行うことで、アンサンブル内の木の数を顕著に削減する。
  • LOFは、トレーニングセット上で全木の予測ベクトルに適用され、各木の出力を高次元空間上の点として扱う。
  • プルーニングプロセスは教師なしであり、再トレーニングを必要とせず、事前に訓練されたランダムフォレストに直接適用される。
  • 本手法は10の実世界データセットを対象に評価され、精度、プルーニング比、計算効率の観点から検証された。

実験結果

リサーチクエスチョン

  • RQ1局所外れ値要因(LOF)は、アンサンブル性能に寄与する多様な木を効果的に同定できるか?
  • RQ2LOFに基づく木選択を用いた場合、ランダムフォレストはどの程度プルーニング可能であり、精度を維持または向上させられるか?
  • RQ3性能が劣化する前に、LOFに基づく選択によって達成可能な最大のプルーニング比は何か?
  • RQ4多様なデータセットにおいて、LOFB-DRFは従来のランダムフォレストと比べて精度と推論速度の点でどのように差を示すか?
  • RQ5多様性に焦点を当てたガイドラインのもとで、極端なプルーニング(例:99%)が予測性能の著しい損失なしに達成可能か?

主な発見

  • LOFB-DRFは、'audit'や'vote'などの複数のデータセットで最大99%のプルーニングを達成し、精度にほとんど損失がなかった。
  • 'sonar'データセットでは、5本の木(95%のプルーニング)で97.97%の精度を維持し、一部の状況では完全なRFを上回った。
  • 'vote'データセットでは、5本の木(95%のプルーニング)で97.97%の精度を達成し、極端な圧縮下でも高い性能を示した。
  • 'soybean'データセットでは、5本の木で77.59%の精度を維持し、一部の設定で完全なRFを上回った。
  • 本手法は、10のすべてのデータセットで、90%を超えるプルーニングレベルであっても、常に完全なランダムフォレストを上回るか同等の性能を示した。
  • 本手法は、モデルのコンactさと予測精度の間で顕著なバランスを達成しており、リアルタイムデプロイメントに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。