Skip to main content
QUICK REVIEW

[論文レビュー] Anomaly Detection in Big Data

Chandresh Kumar Maurya|arXiv (Cornell University)|Mar 3, 2022
Anomaly Detection Techniques and Applications被引用数 4
ひとこと要約

この博士論文は、コストセンシティブ学習、確率的最適化、分散フレームワークを活用して、高次元性、スパarsity、スケーラビリティを扱う、Big Dataにおける異常検出のための新規アルゴリズム—PAGMEAN、ASPGD、DSCIL、CILSD—を提案する。主な貢献は、G-meanの向上と分散環境におけるロバスト性の向上であり、特にKDDCup 2008を含む実世界およびベンチマークデータセットで顕著である。

ABSTRACT

Anomaly is defined as a state of the system that do not conform to the normal behavior. For example, the emission of neutrons in a nuclear reactor channel above the specified threshold is an anomaly. Big data refers to the data set that is \emph{high volume, streaming, heterogeneous, distributed} and often \emph{sparse}. Big data is not uncommon these days. For example, as per Internet live stats, the number of tweets posted per day has gone above 500 millions. Due to data explosion in data laden domains, traditional anomaly detection techniques developed for small data sets scale poorly on large-scale data sets. Therefore, we take an alternative approach to tackle anomaly detection in big data. Essentially, there are two ways to scale anomaly detection in big data. The first is based on the \emph{online} learning and the second is based on the \emph{distributed} learning. Our aim in the thesis is to tackle big data problems while detecting anomaly efficiently. To that end, we first take \emph{streaming} issue of the big data and propose Passive-Aggressive GMEAN (PAGMEAN) algorithms. Although, online learning algorithm can scale well over large number of data points and dimensions, they can not process data when it is distributed at multiple locations; which is quite common these days. Therefore, we propose anomaly detection algorithm which is inherently distributed using ADMM. Finally, we present a case study on anomaly detection in nuclear power plant data.

研究の動機と目的

  • 教師あり手法がラベル不足のため失敗する高次元・スパース・分散Big Data環境における異常検出の課題に対処すること。
  • クラス不均衡およびストリーミングデータ特性を扱えるスケーラブルで効率的かつロバストな異常検出アルゴリズムの開発。
  • 最小限のハイパーパrameterチューニングで実世界への導入を可能にする分散型およびオンライン学習フレームワークの実現。
  • 核電力プラントおよびKDDCup 2008データを含むベンチマークおよび実世界データセット上で性能を評価し、実用的応用の有効性を示すこと。

提案手法

  • 非凸性を扱うために、コストセンシティブ学習におけるサーヴィルス損失関数をパassive-aggressive(PA)フレームワークに統合したPAGMEANを提案。これによりG-mean性能が向上。
  • ストリーミングで高次元なデータを処理するため、Nesterov加速を備えた確率的近位最適化アルゴリズムであるASPGDを導入。コストセンシティブな滑らかなハッチ損失関数を採用。
  • L2正則化付きコストセンシティブ損失関数を用いた分散ADMMフレームワークに基づくDSCILを構築。最適化にはL-BFGS(L-DSCIL)とランダム座標降下法(R-DSCIL)を採用。
  • 学習率チューニングを回避し、リプシッツ定数を用いた適応的ステップサイズを用いるパラメータフリーの分散FISTA型アルゴリズムCILSDを提案。
  • 特に核電力プラント監視におけるラベルなし実世界データに対して、無教師ベースラインとしてSVDDを採用。これにより、ラベルなし環境下での有効性を検証。
  • 複数のデータセットおよびハードウェア構成(マルチコアシステム)において、G-mean、ミス率、F-measure、収束速度といったパフォーマンス指標を用いて評価。

実験結果

リサーチクエスチョン

  • RQ1ラベルが最小限の高次元・スパース・分散Big Data環境において、どのようにして効果的な異常検出を実現できるか?
  • RQ2コストセンシティブ学習は、不均衡な異常検出タスクにおいてG-mean性能を向上させると同時に、低いミス率を維持できるか?
  • RQ3Nesterov加速は、ストリーミングデータ向けオンライン異常検出において性能にどのように影響を与えるか?
  • RQ4ADMMやFISTAのような分散最適化フレームワークにおいて、収束速度、学習時間、G-meanの間にはどのようなトレードオフがあるか?
  • RQ5CILSDのようなパラメータフリー分散アルゴリズムは、チューニング済みの対応アルゴリズムを上回る性能を実現できるか、実世界の異常検出シナリオで有効か?

主な発見

  • PAGMEANは、すべてのベンチマークデータセットで親アルゴリズムであるPAおよびCSOCを上回るG-mean性能を示したが、ミス率は高めであった。
  • ASPGDは、複数のベンチマークデータセットでCSFSOLを上回るG-meanおよびF-measureを達成したが、加速効果が一貫した向上をもたらしたわけではない。
  • L-DSCILは中央集権的ソリューションに近いG-meanを達成し、収束が速かった。一方、R-DSCILはランダム座標更新のため、性能がばらつきを示した。
  • R-DSCILはマルチコアシステムで実用的なスループット向上とスケーラビリティを示し、コア数の増加に伴い学習時間が対数的に短縮された。
  • CILSDは学習率チューニングなしで高いG-meanを達成し、DSCILよりも速く収束。多数のデータセットで中央集権的アルゴリズムを上回るか同等の性能を示した。
  • KDDCup 2008データセットにおいて、R-DSCILおよびCILSDは実世界の分散異常検出における強力な可能性を示した。特にCILSDは収束が早く、安定した性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。