Skip to main content
QUICK REVIEW

[論文レビュー] StreamLearner: Distributed Incremental Machine Learning on Event Streams: Grand Challenge

Christian Mayer, Ruben Mayer|arXiv (Cornell University)|Jun 26, 2017
Data Stream Mining Techniques参考文献 21被引用数 4
ひとこと要約

StreamLearner は、モジュラー API を通じて CEP から機械学習の専門知識を分離することで、リアルタイムのイベントストリーム上でスケーラブルでインクリメンタルな機械学習を可能にする分散型の複雑イベント処理システムである。インクリメンタル K-平均法やマルコフモデルなどのモデルのオンライン学習をサポートし、マルチスレッドおよび共有メモリ環境においても強力なスケーラビリティを実現し、最大で秒間500件のスループットを達成している。

ABSTRACT

Today, massive amounts of streaming data from smart devices need to be analyzed automatically to realize the Internet of Things. The Complex Event Processing (CEP) paradigm promises low-latency pattern detection on event streams. However, CEP systems need to be extended with Machine Learning (ML) capabilities such as online training and inference in order to be able to detect fuzzy patterns (e.g., outliers) and to improve pattern recognition accuracy during runtime using incremental model training. In this paper, we propose a distributed CEP system denoted as StreamLearner for ML-enabled complex event detection. The proposed programming model and data-parallel system architecture enable a wide range of real-world applications and allow for dynamically scaling up and out system resources for low-latency, high-throughput event processing. We show that the DEBS Grand Challenge 2017 case study (i.e., anomaly detection in smart factories) integrates seamlessly into the StreamLearner API. Our experiments verify scalability and high event throughput of StreamLearner.

研究の動機と目的

  • スマートデバイスなどから得られる高速なイベントストリームにおいて、曖昧で変化するパターン(例:異常)を検出する課題に対処すること。
  • 再訓練から再開する必要のないオンラインでのモデル適応を可能にするために、インクリメンタル機械学習を複雑イベント処理(CEP)に統合すること。
  • 動的スケーリングとストリーミングデータの低遅延処理を可能にする分散型、データ並列アーキテクチャを設計すること。
  • 一般用途の API を通じて、既存のインクリメンタル機械学習アルゴリズム(例:K-平均法、マルコフモデル)を CEP パイプラインにシームレスに統合できること。
  • スマート製造環境における実世界の異常検出ワークロードに対して、スケーラビリティと高いスループットを実証すること。

提案手法

  • 分散処理とインクリメンタルモデル更新を抽象化するモジュラーで汎用的な API を用いて、ML のトレーニングおよび推論を CEP ロジックから分離すること。
  • 複数スレッドでイベントストリームのデータ並列処理を可能にするために、スプリッター、ワーカー、マージャーのコンponents を備えたパイプラインアーキテクチャを実装すること。
  • 新しいイベントの到着と古いイベントの有効期限切れに応じてクラスターセンタロイドを動的に更新するスライディングウィンドウを用いたインクリメンタル K-平均法クラスタリングを適用すること。
  • 遷移確率を計算し、低確率の状態シーケンスを異常として検出するために、スライディングウィンドウを用いたマルコフモデルを用いること。
  • 長時間のシーケンスに対して効率を向上させるために、正規化を用いて乗算回数を削減することで、マルコフモデルにおける確率計算を最適化すること。
  • マージャー部のタイムスタンプベースのソートにより出力の一貫性を確保し、正しいストリームセマンティクスを維持するための単調なイベント順序を保証すること。

実験結果

リサーチクエスチョン

  • RQ1インクリメンタル機械学習を、リアルタイムのパターン検出に適した分散型複雑イベント処理システムに効率的に統合する方法は何か?
  • RQ2イベントストリーム上でスケーラブルでデータ並列なインクリメンタル学習を実現するために、どのようなアーキテクチャ的およびプログラミングモデルの抽象化が必要か?
  • RQ3既存のインクリメンタル機械学習アルゴリズム(例:K-平均法、マルコフモデル)が、低遅延要件を満たす分散型 CEP パイプラインでどれほど適応可能か?
  • RQ4ウィンドウサイズ、クラスタ数、ワーカースレッド数を変化させた場合、システムのスループットと遅延はどのように変化するか?
  • RQ5提案されたシステムは、同期のオーバーヘッドを低く抑えつつ、一貫した出力順序を維持しながら、高いスループット(例:秒間500件)を達成できるか?

主な発見

  • StreamLearner は、ノートブックシステムを用いて DEBS Grand Challenge 2017 データセットを用いた場合、最大で秒間500件の絶対的スループットを達成した。
  • ノートブック上で1スレッドから9スレッドにスケーリングした場合、スループットが2.5倍に増加し、中程度から大規模なウィンドウサイズにおいて強いスケーラビリティを示した。
  • 共有メモリインフラストラクチャ上では、スレッド数を増やすことで最大で60%のスループット向上が観察されたが、スレッド数が多いと限界効果が現れた。
  • ウィンドウサイズが大きくなると計算オーバーヘッドが増加するためスループットが低下するが、スレッド並列化の相対的利点はウィンドウサイズが大きくなるほど高まる。
  • クラスタ数を増やすと計算複雑度が上昇するためスループットが低下するが、スレッド数の増加に伴い、ある飽和点まではスループットが向上した。
  • 最適化されたマルコフモデルの確率計算により、乗算回数が $N(W-N)$ から $N+2(W-N)$ に削減され、長時間の遷移シーケンスにおいて効率が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。