Skip to main content
QUICK REVIEW

[論文レビュー] Random Forest Based Approach for Concept Drift Handling

А. В. Жуков, Denis Sidorov|arXiv (Cornell University)|Feb 14, 2016
Data Stream Mining Techniques参考文献 13被引用数 10
ひとこと要約

本稿では、内在的近接性と基本学習器の精度を用いた時間的重み付け、アンサンブルの pruning、および精度重み付き投票を統合することで、概念ずれを扱うための Proximity Driven Streaming Random Forest (PDSRF) 法を提案する。この手法は、スマートグリッドや風力予測のような動的環境において、標準的なランダムフォレストや AWE2 よりも優れた性能を発揮する。

ABSTRACT

Concept drift has potential in smart grid analysis because the socio-economic behaviour of consumers is not governed by the laws of physics. Likewise there are also applications in wind power forecasting. In this paper we present decision tree ensemble classification method based on the Random Forest algorithm for concept drift. The weighted majority voting ensemble aggregation rule is employed based on the ideas of Accuracy Weighted Ensemble (AWE) method. Base learner weight in our case is computed for each sample evaluation using base learners accuracy and intrinsic proximity measure of Random Forest. Our algorithm exploits both temporal weighting of samples and ensemble pruning as a forgetting strategy. We present results of empirical comparison of our method with original random forest with incorporated "replace-the-looser" forgetting andother state-of-the-art concept-drfit classifiers like AWE2.

研究の動機と目的

  • リアルタイムのデータストリームにおける概念ずれの課題に取り組むこと、特にスマートグリッドや再生可能エネルギー予測のような非定常環境において。
  • 時間の経過とともにデータ分布が変化する動的環境において、従来のランダムフォレストの限界を克服すること。
  • 動的なベースラーナーの重み付けと忘れ戦略を用いて、概念ずれに適応するアンサンブル手法を開発すること。
  • 時間的および近接性に基づくサンプルの関連性評価を用いて、時系列的要因を考慮した予測精度を向上させること。
  • 電力系統やセンサデータに一般的に見られる欠損データや非一様なデータ到着に対しても、頑健な分類を可能にすること。

提案手法

  • バギング、ランダムサブスペース法、および動的アンサンブル重み付けを組み合わせた Proximity Driven Streaming Random Forest (PDSRF) を提案する。
  • ランダムフォレストからの内在的近接性測定値を用いて、サンプルの類似度を評価し、ベースラーナーの重み付けを導く。
  • 個々の精度と現在のテストサンプルとの近接性に基づいて、ベースラーナーの重みを計算する。
  • 時間的重み付けを適用して、最近のサンプルを優先し、古くなったデータの影響を低減する。
  • 低性能または古くなった分類器を削除するための忘れ機構としてアンサンブルの pruning を実装する。
  • 分類器の重みを、精度と近接性を用いてサンプルごとに動的に更新する加重多数決投票を採用する。

実験結果

リサーチクエスチョン

  • RQ1どのようにしてランダムフォレストを、データストリーム環境における概念ずれを効果的に処理できるように適応させることができるか?
  • RQ2アンサンブルストリーミング分類において、近接性に基づく類似度と精度重み付き投票を組み合わせた際の影響は何か?
  • RQ3時間的重み付けとアンサンブルの pruning は、標準的な RF と比較して、概念ずれ下での性能をどのように向上させるか?
  • RQ4提案手法は、実世界のストリーミングタスクにおいて、AWE2 やオンラインバギングなどの最先端手法を上回る性能を発揮できるか?
  • RQ5スマートグリッドや再生可能エネルギー応用に一般的に見られる欠損データや非一様なデータ到着下でも、この手法はどのように性能を発揮するか?

主な発見

  • PDSRF 法は、概念ずれを伴うベンチマークデータストリームにおいて、標準的なランダムフォレストや AWE2 よりも高い分類精度を達成する。
  • 近接性と精度に基づく重み付けを組み込むことで、徐々に変化する概念ずれや急激な概念ずれへのモデルの適応性が顕著に向上する。
  • 時間的重み付けとアンサンブルの pruning は、古くなったデータの影響を効果的に低減し、非定常環境下での性能向上に寄与する。
  • 本手法は、実世界のスマートグリッドおよび風力発電データセットで一般的な欠損データに対しても頑健であることが示された。
  • 機械学習および追跡タスクにおける実験的結果から、PDSRF は動的データ分布下でも高い予測性能を維持することが確認された。
  • 内在的近接性と精度重み付けの統合により、静的または単に精度に基づく重み付けよりも、より信頼性が高く適応性の高いアンサンブル意思決定が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。