[论文解读] Learning Representations for Outlier Detection on a Budget
本文提出 BORE(Bagged Outlier Representation Ensemble),一种新颖的监督异常检测框架,通过将无监督异常评分函数(OSFs)作为输入特征,以提升检测性能。通过将多种 OSFs 组合为丰富的表示,并应用预算感知特征选择,BORE 在 12 个真实世界数据集上实现了最先进水平的 AUC 性能,同时在推理时间尊重计算约束。
The problem of detecting a small number of outliers in a large dataset is an important task in many fields from fraud detection to high-energy physics. Two approaches have emerged to tackle this problem: unsupervised and supervised. Supervised approaches require a sufficient amount of labeled data and are challenged by novel types of outliers and inherent class imbalance, whereas unsupervised methods do not take advantage of available labeled training examples and often exhibit poorer predictive performance. We propose BORE (a Bagged Outlier Representation Ensemble) which uses unsupervised outlier scoring functions (OSFs) as features in a supervised learning framework. BORE is able to adapt to arbitrary OSF feature representations, to the imbalance in labeled data as well as to prediction-time constraints on computational cost. We demonstrate the good performance of BORE compared to a variety of competing methods in the non-budgeted and the budgeted outlier detection problem on 12 real-world datasets.
研究动机与目标
- 解决纯监督异常检测方法的局限性,后者因标注数据稀缺而难以应对类别不平衡和新型异常类型。
- 通过表示学习框架利用标注数据,克服无监督方法预测性能差的问题。
- 开发一种可扩展、泛化能力强的方法,将多种无监督 OSFs 整合到监督学习流程中,且无需复杂的超参数调优。
- 通过在测试时间引入预算感知特征选择策略,实现在计算资源约束下的高效推理。
- 提供一个统一、可解释的框架,其中最终输出可解释为异常概率,不同于许多无监督集成方法。
提出的方法
- 使用多个无监督异常评分函数(OSFs)对每个数据点进行变换,将其输出视为非线性特征表示。
- 使用标注的正常/异常数据,在组合的 OSF 特征上训练监督分类器(具体为袋装集成模型),并通过子采样处理类别不平衡问题。
- 应用袋装和稳定性选择以增强在高度不平衡数据集中的鲁棒性,提升泛化能力并降低方差。
- 引入基于正交匹配追踪(OMP)的预算感知特征选择过程,选择在用户定义计算预算内最大化预测性能的 OSF 子集。
- 确保特征选择过程考虑每个 OSF 的不同计算成本,从而实现实时或嵌入式系统中的高效推理。
- 将最终分类器的输出用作异常程度的校准概率估计,实现可解释性并支持实际部署。
实验结果
研究问题
- RQ1将无监督异常评分函数组合到监督表示学习框架中,是否能显著提升异常检测性能,相比独立的无监督或监督方法?
- RQ2BORE 框架在异常检测中如何处理类别不平衡问题,特别是在标注异常样本极其稀少的情况下?
- RQ3预算感知特征选择在多大程度上能降低预测时间的计算成本,同时不牺牲检测性能?
- RQ4所提出方法在具有不同数据分布和异常特征的多样化真实世界数据集上是否具有良好的泛化能力?
- RQ5BORE 框架是否可以扩展以集成新的 OSFs 或领域特定知识,而无需从头开始重新训练?
主要发现
- 在 12 个真实世界数据集中,BORE 在 AUC 和 AUC@0.1 指标上均优于无监督和监督基线方法,尤其在类别不平衡设置下表现突出。
- 在 12 个数据集中的 9 个中,对于任意给定的计算预算,BORE-Budget 的 AUC 和 AUC@0.1 均高于对比方法,证明其在性能-效率权衡上的优越性。
- 预算感知特征选择策略(BORE-Budget)在预算降低时表现出更平滑的性能退化,优于随机选择和未考虑成本的 OMP 方法。
- 随着使用更多样化且数量更多的 OSFs,BORE 的性能进一步提升,证实了在计算约束放宽时,表示丰富性的优势。
- 即使在严格的预算约束下,BORE-Budget 仍保持强劲性能,表明选择少量信息量高的 OSFs 可有效维持高检测准确率。
- 该方法对袋装和稳定性选择引入的不稳定性具有鲁棒性,表现为随着预算增加,AUC 呈单调提升趋势,尽管存在轻微波动。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。