[论文解读] Anomaly Detection in the Presence of Missing Values
本文提出并评估了五种在存在缺失值情况下的异常检测策略:均值填补、MAP填补、特征袋化(降维)、边缘化(用于密度估计器)以及比例分配(用于基于树的模型)。实验结果表明,MAP填补和比例分配优于其他方法,而边缘化在EGMM中表现强劲,因此根据各算法特点提出相应建议:对孤立森林推荐比例分配,对LODA推荐MAP填补,对EGMM推荐边缘化。
Standard methods for anomaly detection assume that all features are observed at both learning time and prediction time. Such methods cannot process data containing missing values. This paper studies five strategies for handling missing values in test queries: (a) mean imputation, (b) MAP imputation, (c) reduction (reduced-dimension anomaly detectors via feature bagging), (d) marginalization (for density estimators only), and (e) proportional distribution (for tree-based methods only). Our analysis suggests that MAP imputation and proportional distribution should give better results than mean imputation, reduction, and marginalization. These hypotheses are largely confirmed by experimental studies on synthetic data and on anomaly detection benchmark data sets using the Isolation Forest (IF), LODA, and EGMM anomaly detection algorithms. However, marginalization worked surprisingly well for EGMM, and there are exceptions where reduction works well on some benchmark problems. We recommend proportional distribution for IF, MAP imputation for LODA, and marginalization for EGMM.
研究动机与目标
- 为填补现有异常检测方法在测试时处理缺失值方面的空白,因为标准方法假设所有特征均可观测。
- 评估并比较五种不同的缺失值处理策略:均值填补、MAP填补、通过特征袋化实现的降维、边缘化,以及基于树的模型的比例分配。
- 确定在不同算法和缺失数据率下,哪种方法能实现最高的异常检测性能(以AUC衡量)。
- 为在孤立森林、LODA和EGMM中实现缺失值处理提供实用建议。
提出的方法
- 提出五种用于处理测试查询中缺失值的方法:均值填补、MAP填补、通过特征袋化实现的降维、边缘化(用于基于密度的模型),以及比例分配(用于基于树的模型)。
- 将每种方法应用于三种主流异常检测算法:孤立森林(IF)、LODA和EGMM,使用合成数据集和基准数据集进行实验。
- 以受试者工作特征曲线下面积(AUC)作为主要评估指标,比较不同方法和缺失数据率(ρ = 0.1% 至 10%)下的性能表现。
- 采用母集方法,每种算法使用13–15个数据集,通过多次运行的平均结果评估方法的鲁棒性。
- 对于边缘化方法,计算全维空间的尾部概率以确保有效比较,避免在不同维度间直接比较密度。
- 通过理论分析证明MAP填补和比例分配优于均值填补和降维方法。
实验结果
研究问题
- RQ1当测试时特征缺失时,哪种缺失值处理策略能为孤立森林带来最高的AUC?
- RQ2在不同缺失数据率下,MAP填补与均值填补和降维在LODA中的性能表现如何比较?
- RQ3为何尽管存在维度不匹配的理论担忧,边缘化在EGMM中表现出人意料的良好性能?
- RQ4比例分配是否可作为孤立森林等基于树的异常检测器中MAP填补的更高效替代方案?
- RQ5特征袋化(降维)在何种情况下会失效,又在何种情况下仍可能有效?
主要发现
- 比例分配在孤立森林中优于均值填补和降维方法,尤其在较高缺失数据率(ρ ≥ 0.5)时表现出显著性能优势,因此被推荐为最高效的方法。
- MAP填补在所有缺失数据率下均对LODA取得最佳结果,显著优于Pevnỳ提出的原始降维方法。
- 边缘化在EGMM中表现令人惊讶地出色,在ρ ≥ 0.4时平均AUC最高,且在12个母集中的6个中表现最佳。
- 与MAP填补和比例分配相比,均值填补始终表现欠佳,验证了理论预期。
- 降维在IF和LODA中表现较差,尤其当非缺失特征数量低于√d时,AUC会退化至0.5。
- 尽管存在理论局限,边缘化仍能生成有效的异常评分,因为所有测试查询的缺失特征数量相近,从而保持了相对概率比较的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。