Skip to main content
QUICK REVIEW

[論文レビュー] Online Ensemble Learning for Imbalanced Data Streams

Boyu Wang, Joëlle Pineau|arXiv (Cornell University)|Oct 30, 2013
Data Stream Mining Techniques被引用数 11
ひとこと要約

本稿では、バッチ版のコストセンシティブなバギングおよびブースティングアルゴリズムをオンラインストリーミング環境に拡張するオンラインコストセンシティブなアンサンブル学習フレームワークを提案する。これにより、不均衡なデータストリームからのリアルタイム学習が可能となる。本手法は理論的にバッチ版に収束することを保証し、ベンチマークデータセットにおいて優れた性能を示す。特に、AUCと一貫性の観点で、オンラインバギングがブースティングを上回っている。

ABSTRACT

While both cost-sensitive learning and online learning have been studied extensively, the effort in simultaneously dealing with these two issues is limited. Aiming at this challenge task, a novel learning framework is proposed in this paper. The key idea is based on the fusion of online ensemble algorithms and the state of the art batch mode cost-sensitive bagging/boosting algorithms. Within this framework, two separately developed research areas are bridged together, and a batch of theoretically sound online cost-sensitive bagging and online cost-sensitive boosting algorithms are first proposed. Unlike other online cost-sensitive learning algorithms lacking theoretical analysis of asymptotic properties, the convergence of the proposed algorithms is guaranteed under certain conditions, and the experimental evidence with benchmark data sets also validates the effectiveness and efficiency of the proposed methods.

研究の動機と目的

  • 少数クラスの例がまれであるが、見逃すと高コストであるクラス不均衡を伴うデータストリームからの学習の課題に対処する。
  • オンライン学習とコストセンシティブ学習の2つがそれぞれ広く研究されているが、ほとんど統合されていない分野のギャップを埋める。
  • バッチ版のコストセンシティブなアンサンブルアルゴリズム(例:バギング、ブースティング)の理論的裏付けのあるオンライン版を、収束保証とともに開発する。
  • フレームワークへの簡単な修正により、非ステーションナリィ環境におけるコンセプトドリフトへの適応を可能にする。
  • 指定された条件下で、オンラインモデルが漸近的にそのバッチモード版に収束することを保証する。

提案手法

  • バッチ版のコストセンシティブなバギングおよびブースティングをインクリメンタル学習に一般化する、一般的なオンラインコストセンシティブなアンサンブルフレームワークを提案する。
  • オンラインモデルの更新時にマイノリティクラスの例を優先するために、重み付きサンプリングとコストセンシティブな損失関数を用いる。
  • コンセプトドリフトへの対応として、統計およびモデルパラメータの適応的更新に忘却係数(例:β = 0.9)を組み込む。
  • 既存のオンラインアルゴリズム(例:AdaC2、CSB2)を、コストセンシティブな重み付けとインクリメンタルパラメータ推定を統合することで変更する。
  • LDA、QDA、ナイーブベイズなどのベースラーナーにフレームワークを適用し、それらをコストセンシティブなオンライン版に拡張する。
  • オンラインAUCを主な評価指標として用い、モデルの更新前に各例の予測を行うことで計算する。

実験結果

リサーチクエスチョン

  • RQ1特定の条件下で、オンラインコストセンシティブなアンサンブル学習アルゴリズムは、漸近的にそのバッチモード版に収束するか?
  • RQ2提案されたフレームワークは、不均衡なデータストリームにおけるバッチ版コストセンシティブなアンサンブルと比較して、AUCおよび一貫性の観点でどの程度の性能を示すか?
  • RQ3本フレームワークは、急激な変化、徐々の変化、または混合ドリフトを伴う非ステーションナリィなデータストリームに対処できるか?
  • RQ4不均衡なデータストリームにおいて、オンラインバギングは性能と安定性の観点でオンラインブースティングを上回るか?
  • RQ5本フレームワークは、任意のコストインセンシティブなオンライン学習アルゴリズムに適用可能であり、それらをコストセンシティブに変換できるか?

主な発見

  • オンラインバギングに基づくアルゴリズム(例:UnderOverBagging、SMOTEBagging)は、すべてのベンチマークデータセットでブースティングベースの手法よりも高いAUCとより優れた一貫性を達成した。
  • SINE1(急激なコンセプトドリフト)では、非ステーションナリィ版のLDA(nsLDA)が平均オンラインAUC 0.8885 ± 0.0157を達成し、標準LDA(0.7747 ± 0.0408)を顕著に上回った。
  • SINE1におけるナイーブベイズの非ステーションナリィ拡張(nsNB)は、AUCを 0.5275 ± 0.0309 から 0.7270 ± 0.0436 まで向上させ、急激なドリフトの処理における有効性を示した。
  • SINE1G(徐々のドリフト)では、nsLDAとnsQDAがそれぞれAUC 0.5833 ± 0.0680 および 0.5944 ± 0.0637 を達成し、標準モデルよりも優れたロバストネスを示した。
  • AdaC2およびCSB2をオンライン版に拡張する際に、理論的収束保証とともに、バッチ版と同等の性能を達成した。
  • 提案手法は、混合ドリフト(SINE1M)に対しても柔軟に適応でき、nsLDAとnsQDAはそれぞれAUC 0.6348 ± 0.0372 および 0.6048 ± 0.0355 を達成し、標準モデルを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。