Skip to main content
QUICK REVIEW

[論文レビュー] Concept-drifting Data Streams are Time Series; The Case for Continuous Adaptation

Jesse Read|arXiv (Cornell University)|Oct 4, 2018
Data Stream Mining Techniques参考文献 14被引用数 12
ひとこと要約

本稿では、概念の変化を示すデータストリームが、時間的依存性を示すため、本質的に時系列であると主張し、ストリーム学習における一般的なi.i.d.仮定に疑問を呈する。時間的依存性が存在する中で、破壊的リセット手法(例:ホイーリングツリー)に代わって、確率的勾配降下法(SGD)による連続的適応が優れていると示し、特に多項式特徴ベースを用いることで、明示的なドリフト検出を伴わず、高い精度と効率性を達成していることを実証している。

ABSTRACT

Learning from data streams is an increasingly important topic in data mining, machine learning, and artificial intelligence in general. A major focus in the data stream literature is on designing methods that can deal with concept drift, a challenge where the generating distribution changes over time. A general assumption in most of this literature is that instances are independently distributed in the stream. In this work we show that, in the context of concept drift, this assumption is contradictory, and that the presence of concept drift necessarily implies temporal dependence; and thus some form of time series. This has important implications on model design and deployment. We explore and highlight the these implications, and show that Hoeffding-tree based ensembles, which are very popular for learning in streams, are not naturally suited to learning \emph{within} drift; and can perform in this scenario only at significant computational cost of destructive adaptation. On the other hand, we develop and parameterize gradient-descent methods and demonstrate how they can perform \emph{continuous} adaptation with no explicit drift-detection mechanism, offering major advantages in terms of accuracy and efficiency. As a consequence of our theoretical discussion and empirical observations, we outline a number of recommendations for deploying methods in concept-drifting streams.

研究の動機と目的

  • データストリーム学習における広く受け入れられているi.i.i.d.仮定を挑戦し、概念の変化が存在する状況ではその仮定が矛盾することを示す。
  • 概念の変化が本質的に時間的依存性を意味することを示し、データストリームを時系列として再定式化する。
  • ホイーリングツリーで用いられる標準的な「検出してリセットする」戦略に代えて、勾配に基づく手法による連続的適応がより効果的であると主張する。
  • 実験的に、SGDベースのモデルが概念の変化下で、ホイーリングツリーのアンサンブルに比べて精度と計算効率に優れることを検証する。
  • ストリーミング機械学習におけるニューラルネットワークやパrameterized勾配法のより広範な採用を提唱する。

提案手法

  • 理論的分析により、概念の変化が時間的依存性を意味することを示し、データストリームが本質的に時系列であることを示す。
  • 多項式特徴ベース(次数2および3)を用いた確率的勾配降下法(SGD)を、連続的適応のメカニズムとして提案する。
  • 予測的評価(prequential evaluation)を用いて、実データおよび合成データストリーム上のモデル性能を評価する。
  • k-NN、ホイーリングツリー(HT)、およびHTのランダムフォレスト(RF-HT)と比較し、複数のデータセットで評価する。
  • k-NNにはサイズwの移動ウィンドウを、SGDには固定されたモデルパラメータを適用し、段階的学習を保証する。
  • 時間的および空間的計算量の複雑度を分析し、SGDがストリーム長に依存せず常にO(d)の複雑度を維持するのに対し、HTは木の深さとリセットサイクルに伴いO(ℓd)に増加することを示す。

実験結果

リサーチクエスチョン

  • RQ1概念の変化を示すデータストリームにおいて、i.i.i.d.仮定は妥当なのか、それともドリフトが本質的に時間的依存性を生じさせるのか?
  • RQ2勾配降下法による連続的適応は、ホイーリングツリーのアンサンブルで用いられる標準的な「検出してリセットする」戦略を上回るのか?
  • RQ3概念の変化下で、k-NN、ホイーリングツリー、SGDベースのモデルの間で、計算コストと精度のトレードオフはどのように変化するか?
  • RQ4多様なデータストリームタイプにおいて、SGDベースのモデルの性能は、ツリーに基づくアンサンブルと比べてどの程度か?
  • RQ5明示的なドリフト検出を伴わず、勾配に基づく手法をストリーミング環境に効果的にパラメータ化できるか?

主な発見

  • 多項式特徴ベースのSGD(PBF-SGD)は、全テストデータセットでホイーリングツリーのアンサンブルを上回る高い精度を達成した。具体的には、Electricityで85.9%、RTGで81.8%、CoverTypeで92.6%、Syntheticストリームで95.1%であった。
  • ホイーリングツリーのアンサンブル(RF-HT)は、Electricityで86.2%、RTGで77.9%、CoverTypeで93.9%、Syntheticストリームで93.6%の精度を達成したが、木の成長とリセットサイクルにより、高い計算コストを要した。
  • k-NNは、Electricityで79.8%、RTGで78.8%、CoverTypeで93.3%、Syntheticで96.0%の精度を示したが、固定バッファサイズの制限により性能に限界があった。
  • SGDは、常にO(d)の時間的および空間的計算量を維持したのに対し、ホイーリングツリーは木の深さとリセットに伴いO(ℓd)に増加した。
  • SGDの合計実行時間は、特に持続的なドリフトが続く長時間ストリームにおいて、HTベースの手法に比べて顕著に低かった。
  • 本研究では、連続的適応によるSGDが、特にドリフトが徐々に進行するか持続的である場合には、破壊的適応よりも効率的かつ正確であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。