Skip to main content
QUICK REVIEW

[論文レビュー] A Bayesian Ensemble for Unsupervised Anomaly Detection

Edward H. Yu, Parth J. Parekh|arXiv (Cornell University)|Oct 24, 2016
Anomaly Detection Techniques and Applications参考文献 13被引用数 8
ひとこと要約

本稿では、ベイジアン分類器結合を用いて複数の異常検出器を統合するベイジアンアンサンブル手法を提案する。この手法により、異常である確率の解釈可能性、個々の検出器の誤差率、および信頼性の低い検出器に対するロバスト性が実現される。実世界の時系列データにおいて、多数決投票より28.7%低い誤差率を達成した。

ABSTRACT

Methods for unsupervised anomaly detection suffer from the fact that the data is unlabeled, making it difficult to assess the optimality of detection algorithms. Ensemble learning has shown exceptional results in classification and clustering problems, but has not seen as much research in the context of outlier detection. Existing methods focus on combining output scores of individual detectors, but this leads to outputs that are not easily interpretable. In this paper, we introduce a theoretical foundation for combining individual detectors with Bayesian classifier combination. Not only are posterior distributions easily interpreted as the probability distribution of anomalies, but bias, variance, and individual error rates of detectors are all easily obtained. Performance on real-world datasets shows high accuracy across varied types of time series data.

研究の動機と目的

  • 既存の教師なし異常検出アンサンブル手法における解釈可能性の欠如と理論的根拠の不足に対処すること。
  • ラベルなしデータを用いても、個々の検出器のバイアス、分散、誤差率を推定可能にすること。
  • 一部の検出器が信頼性が低いまたは不正確であっても、依然として正確なアンサンブルを構築すること。
  • 異常検出出力を確率分布として統合する整合的なベイジアンフレームワークを提供すること。

提案手法

  • 本手法は、真の異常状態と検出器誤差率を共役事前分布を用いた潜在変数としてモデル化し、ベイジアン分類器結合を採用する。
  • 変分ベイジアン推論を用いて、真のラベルと個々の検出器の誤分類行列の事後分布を同時に推定する。
  • モデルは、すべての検出器からの不確実性を組み込んだ、データポイントが異常であるとされる事後確率を推定する。
  • ベータ事前分布のハイパーパrameterは、推定誤差率と真のラベル確率の経験的平均と分散に一致するように設定される。
  • 期待値最大化に類似したスキームを用いて、反復的に検出器の正確性と真のラベルの推定値を更新する。
  • 最終的な異常判断は、異常確率の事後平均に基づくものであり、信頼度スコアとして解釈可能である。

実験結果

リサーチクエスチョン

  • RQ1ベイジアンアンサンブルフレームワークは、教師なし異常検出における解釈可能性と理論的厳密性を向上させることができるか?
  • RQ2ラベルなしデータを用いても、個々の検出器の誤差率、バイアス、分散を信頼性高く推定できるか?
  • RQ3一部の検出器が著しく不正確またはランダムな場合、アンサンブルの性能はどのように変化するか?
  • RQ4信頼性の低い検出器が含まれても、アンサンブルは高い正確性を維持できるか?

主な発見

  • ベイジアンアンサンブルは、実世界のYahoo!トラフィックデータにおいて1.76%の誤差率を達成し、次に優れた手法(多数決投票)と比較して28.7%の誤差率低減を実現した。
  • 本モデルは585件の真陽性とわずか586件の偽陽性を検出したが、多数決投票は1,137件の偽陽性を記録した。
  • 50%の正確性を持つランダム検出器を導入した場合、ベイジアンアンサンブルは誤差率が0.176%のまま維持されたが、多数決投票の誤差率は179%上昇した。
  • 事後分布の分析から、ランダム検出器の真正陽性率が0.522であることが判明し、信頼性の低い検出器として特定され、重み付けが低下した。
  • 本モデルは解釈可能な出力を提供し、異常である事後確率と個々の検出器の誤差率を含むため、詳細な性能分析が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。