Skip to main content
QUICK REVIEW

[论文解读] A Bayesian Ensemble for Unsupervised Anomaly Detection

Edward H. Yu, Parth J. Parekh|arXiv (Cornell University)|Oct 24, 2016
Anomaly Detection Techniques and Applications参考文献 13被引用 8
一句话总结

本文提出了一种用于无监督异常检测的贝叶斯集成方法,通过贝叶斯分类器组合技术整合多个异常检测器,能够提供异常的可解释后验概率、各检测器的错误率估计,并对不可靠检测器具有鲁棒性。该方法在真实世界的时间序列数据上相比多数投票方法将错误率降低了28.7%。

ABSTRACT

Methods for unsupervised anomaly detection suffer from the fact that the data is unlabeled, making it difficult to assess the optimality of detection algorithms. Ensemble learning has shown exceptional results in classification and clustering problems, but has not seen as much research in the context of outlier detection. Existing methods focus on combining output scores of individual detectors, but this leads to outputs that are not easily interpretable. In this paper, we introduce a theoretical foundation for combining individual detectors with Bayesian classifier combination. Not only are posterior distributions easily interpreted as the probability distribution of anomalies, but bias, variance, and individual error rates of detectors are all easily obtained. Performance on real-world datasets shows high accuracy across varied types of time series data.

研究动机与目标

  • 解决现有无监督异常检测集成方法在可解释性和理论基础方面的不足。
  • 在无标签数据条件下实现对单个检测器偏差、方差和错误率的估计。
  • 开发一种鲁棒的集成方法,即使在部分检测器不可靠或不准确时仍能保持准确性。
  • 为异常检测输出的概率分布提供一个合理的贝叶斯框架以实现组合。

提出的方法

  • 该方法采用贝叶斯分类器组合技术,将真实异常状态和检测器错误率建模为具有共轭先验的隐变量。
  • 采用变分贝叶斯推断方法,联合估计真实标签和各检测器混淆矩阵的后验分布。
  • 该模型估计数据点为异常的后验概率,综合考虑所有检测器的不确定性。
  • 通过设置贝塔先验的超参数,使其与估计错误率和真实标签概率的经验均值和方差相匹配。
  • 算法采用类似期望-最大化的过程,迭代更新检测器准确率和真实标签的估计值。
  • 最终的异常判断基于异常概率后验均值,该值可解释为置信度分数。

实验结果

研究问题

  • RQ1贝叶斯集成框架能否提升无监督异常检测的可解释性和理论严谨性?
  • RQ2在无标签数据条件下,能否可靠估计单个检测器的错误率、偏差和方差?
  • RQ3当部分检测器高度不准确或为随机判断时,该集成方法表现如何?
  • RQ4在包含不可靠检测器的情况下,该集成方法能否维持高准确性?

主要发现

  • 该贝叶斯集成方法在真实世界Yahoo!流量数据上实现了1.76%的错误率,相比次优方法(多数投票)降低了28.7%的错误率。
  • 该模型检测到585个真正例,仅产生586个假正例,优于多数投票方法(假正例达1,137个)。
  • 即使引入一个准确率为50%的随机检测器,贝叶斯集成的错误率仍保持在0.176%不变,而多数投票的错误率则上升了179%。
  • 后验分布显示,该随机检测器的真正例率约为0.522,证实其被识别为不可靠并被相应降低权重。
  • 该模型提供了可解释的输出,包括异常的后验概率和各检测器的错误率,支持详细的性能分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。