[论文解读] A Large-scale Study on Unsupervised Outlier Model Selection: Do Internal Strategies Suffice?
本文对无监督异常值模型选择(UOMS)开展了大规模实证研究,评估了7种内部模型评估策略——独立型与共识型——在297个模型和39个真实数据集上的表现。研究发现,尽管共识型方法优于随机选择,但均未超越使用随机超参数的单一iForest模型的性能,揭示了UOMS技术仍有巨大的改进空间。
Given an unsupervised outlier detection task, how should one select a detection algorithm as well as its hyperparameters (jointly called a model)? Unsupervised model selection is notoriously difficult, in the absence of hold-out validation data with ground-truth labels. Therefore, the problem is vastly understudied. In this work, we study the feasibility of employing internal model evaluation strategies for selecting a model for outlier detection. These so-called internal strategies solely rely on the input data (without labels) and the output (outlier scores) of the candidate models. We setup (and open-source) a large testbed with 39 detection tasks and 297 candidate models comprised of 8 detectors and various hyperparameter configurations. We evaluate 7 different strategies on their ability to discriminate between models w.r.t. detection performance, without using any labels. Our study reveals room for progress -- we find that none would be practically useful, as they select models only comparable to a state-of-the-art detector (with random configuration).
研究动机与目标
- 评估无监督(内部)模型评估策略在无真实标签情况下选择异常值检测模型的有效性。
- 确定现有UOMS方法是否能可靠地选择出优于随机选择或最先进检测器的模型。
- 在统一的大规模基准上系统比较多样化的内部策略,包括独立型与共识型方法。
- 揭示当前UOMS技术的局限性,并推动元学习与共识驱动模型选择的未来研究。
- 发布一个包含297个模型和39个数据集的大型开源测试平台,以加速无监督模型选择的未来研究。
提出的方法
- 构建了一个大规模测试平台,包含8种最先进异常值检测器和297种超参数配置,覆盖来自公共存储库的39个真实世界数据集。
- 评估了7种内部模型选择策略:3种现有UOMS方法(IREOS、EM/MV、UDR)、2种深度表示学习技术(Duan et al., 2020;Lin et al., 2020),以及2种新型共识型方法(MC、HITS、Ens、MC_S),其灵感源自真相发现与集成学习。
- 使用配对统计检验(Wilcoxon signed-rank)比较不同策略的模型选择性能,评估指标包括AUC-PR、AUC-ROC和AP。
- 应用共识型方法,通过聚合模型池中所有模型的预测结果,利用一致性模式对模型进行排序。
- 测量运行时间以评估计算效率,特别是IREOS和MC等计算密集型方法的性能。
- 复用并适配原本用于众包和真相发现的共识算法(如基于NDCG的排序、HITS、集成伪似然)用于UOMS。
实验结果
研究问题
- RQ1现有用于UOMS的内部模型评估策略能否可靠地选择出优于随机选择和最先进检测器的模型?
- RQ2利用模型间一致性进行聚合的共识型模型选择策略,在无监督异常值模型选择中是否显著优于独立型方法?
- RQ3所选模型的性能与使用随机超参数的iForest模型相比如何,后者是本研究中的强基线?
- RQ4不同UOMS策略的计算成本如何?是否如HITS和Ens等快速方法能在不牺牲准确性的前提下实现有竞争力的性能?
- RQ5任何UOMS方法所选最佳模型与每个数据集的实际最佳模型之间是否存在显著性能差距?
主要发现
- 三种专为异常值检测设计的现有UOMS方法(IREOS、EM/MV、UDR)均未显著优于随机选择,表明其在实际应用中效果有限。
- 所有共识型UOMS方法(MC、HITS、Ens、MC_S)均显著优于随机选择,但与使用随机超参数的iForest相比无统计学差异。
- 共识型方法的性能与iForest-r相当,各数据集上的性能差异集中在零附近,表明未实现对单一iForest模型的实质性改进。
- IREOS是唯一显著优于随机选择的方法,但其性能提升以极高的计算成本为代价——在最大数据集(ALOI)上耗时超过16天。
- MC计算成本较高(与模型数量的平方成正比),而HITS、Ens和MC_S均快速(在ALOI上均少于10分钟)且表现具有竞争力,因此是实用的候选方案。
- 本研究揭示了每个数据集中最佳模型与任何UOMS方法所选最佳模型之间存在显著差距,表明无监督模型选择领域仍有巨大改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。