Skip to main content
QUICK REVIEW

[論文レビュー] On Extreme Pruning of Random Forest Ensembles for Real-time Predictive Applications

Khaled Fawagreh, Mohamed Medhat Gaber|arXiv (Cornell University)|Mar 17, 2015
Machine Learning and Data Classification参考文献 48被引用数 3
ひとこと要約

本稿では、分類行動に基づいて意思決定木をクラスタリングすることで多様で代表的な木を選択する、ランダムフォレストアンサンブル向けの新しい極端なプルーニング手法であるCLUB-DRFを提案する。木をクラスタリングし、各クラスタから1本のみを保持することで、最大99%のプルーニングを達成しつつ、元のランダムフォレストの精度を維持または上回る。これにより、17–100倍高速な推論が可能となり、リアルタイムでのデプロイが実現できる。

ABSTRACT

Random Forest (RF) is an ensemble supervised machine learning technique that was developed by Breiman over a decade ago. Compared with other ensemble techniques, it has proved its accuracy and superiority. Many researchers, however, believe that there is still room for enhancing and improving its performance accuracy. This explains why, over the past decade, there have been many extensions of RF where each extension employed a variety of techniques and strategies to improve certain aspect(s) of RF. Since it has been proven empiricallthat ensembles tend to yield better results when there is a significant diversity among the constituent models, the objective of this paper is twofold. First, it investigates how data clustering (a well known diversity technique) can be applied to identify groups of similar decision trees in an RF in order to eliminate redundant trees by selecting a representative from each group (cluster). Second, these likely diverse representatives are then used to produce an extension of RF termed CLUB-DRF that is much smaller in size than RF, and yet performs at least as good as RF, and mostly exhibits higher performance in terms of accuracy. The latter refers to a known technique called ensemble pruning. Experimental results on 15 real datasets from the UCI repository prove the superiority of our proposed extension over the traditional RF. Most of our experiments achieved at least 95% or above pruning level while retaining or outperforming the RF accuracy.

研究の動機と目的

  • 大規模なランダムフォレストアンサンブルの計算およびメモリのオーバーヘッドを削減し、リアルタイム応用に適応すること。
  • クラスタリングに基づくプルーニングによって木の多様性を保ちながら予測性能を向上させること。
  • 木の数を著しく削減しながらも、精度を維持または向上させるプルーニング戦略を開発すること。
  • 多様なクラスタから得られる代表木が、完全なアンサンブルを上回るか同等の性能を発揮することを示すこと。
  • UCIレポジトリの多様な実世界のデータセットを用いて、手法の有効性を検証すること。

提案手法

  • トレーニングデータのサブセット上で木の予測行動に基づいてランダムフォレスト内の意思決定木をクラスタリングする。
  • 類似した分類出力を示す木をクラスタにグループ化するため、クラスタリングアルゴリズム(例:k-means)を用いる。
  • 各クラスタから代表木(通常は重心または最も精度の高い木)を1つ選択する。
  • これらの代表木のみから構成されるプルーニング済みアンサンブル(CLUB-DRF)を形成し、推論コストを低減する。
  • 最終予測のためにプルーニング済みアンサンブルで多数決を実行し、推論時間を著しく短縮する。
  • 木間の予測類似度を計算するためにデータセットのサブセットを用い、効率的なクラスタリングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1予測行動に基づく木のクラスタリングは、ランダムフォレストにおける重複木を特定できるか?
  • RQ2各クラスタから1つの代表木を選択することで、完全なアンサンブルと比較して分類精度が維持または向上するか?
  • RQ3元のランダムフォレストの性能を維持または上回る範囲で、木の数をどの程度まで削減できるか(つまり、どの程度のプルーニング水準に達するか)?
  • RQ4多様なデータセットにおいて、プルーニング済みアンサンブル(CLUB-DRF)は元のランダムフォレストと比較して推論速度と精度の点でどのように差が現れるか?
  • RQ5クラスタリングに基づくプルーニング手法は、さまざまな種類の実世界のデータセットに対して頑健であるか?

主な発見

  • 提案手法のCLUB-DRFは、15のUCIデータセットにおいて94%~99%のプルーニングを達成したが、元のランダムフォレストと同等またはそれ以上の精度を維持した。
  • 平均して、プルーニング済みアンサンブルは、完全なランダムフォレストと比較して1インスタンスあたり17~100倍速くなった。
  • 15のデータセットのうち13つで、プルーニング済みアンサンブルが元のランダムフォレストと同等または高い精度を達成した。特に、voteデータセットでは95%のプルーニングで95.95%の精度(RFは95.74%)を記録した。
  • sonar(95%プルーニング時で96.62%の精度)やwhite clover(95%プルーニング時で92.86%の精度)など、多様なデータセットにおいて一貫した性能を示した。
  • クラスタリングに基づくアプローチは多様性を効果的に捉えており、各クラスタの代表木が完全なアンサンブルを上回るか同等の性能を発揮したことが裏付けられた。
  • プルーニングモデルは、全テストデータセットで高いF1スコアとAUC値を維持しており、精度と再現率の両面で頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。