[论文解读] Data Augmentation by AutoEncoders for Unsupervised Anomaly Detection
本文提出使用自编码器(AEs)生成有意义的潜在空间数据增强,以提升异常检测中无监督一类分类器(OCCs)的性能。通过在正常数据上训练自编码器,并利用其学习到的潜在表示来增强训练集,该方法显著提升了OCC的性能,尤其在高维和小样本场景下表现更优,优于SMOTE、ADASYN和基于噪声的增强方法,在多个基准数据集上表现突出。
This paper proposes an autoencoder (AE) that is used for improving the performance of once-class classifiers for the purpose of detecting anomalies. Traditional one-class classifiers (OCCs) perform poorly under certain conditions such as high-dimensionality and sparsity. Also, the size of the training set plays an important role on the performance of one-class classifiers. Autoencoders have been widely used for obtaining useful latent variables from high-dimensional datasets. In the proposed approach, the AE is capable of deriving meaningful features from high-dimensional datasets while doing data augmentation at the same time. The augmented data is used for training the OCC algorithms. The experimental results show that the proposed approach enhance the performance of OCC algorithms and also outperforms other well-known approaches.
研究动机与目标
- 解决一类分类器(OCCs)在高维、稀疏或小训练集场景下的性能不佳问题。
- 探究自编码器是否能生成有意义的潜在空间数据增强,以提升OCC的泛化能力。
- 在不依赖标注异常样本的前提下提升异常检测性能,保持无监督学习的约束条件。
- 在具有不同异常类型和稀疏性的多样化真实世界数据集上,评估AE生成增强的有效性。
提出的方法
- 在仅包含正常样本的训练数据上训练深度自编码器,以学习瓶颈层中的压缩非线性表示。
- 在训练过程的多个训练周期中提取已训练AE的潜在向量,以生成增强的训练样本。
- 使用增强后的潜在数据重新训练一类分类器(如LOF、孤立森林、KDE),以改善边界学习。
- 在所有数据集上使用相同的自编码器架构,以确保公平比较,包括高维稀疏数据集(如InternetAds,含1558个特征)。
- 采用统计检验(Wilcoxon符号秩检验)评估所提方法与基线增强方法(如添加噪声)之间性能差异的显著性。
- 使用标准指标评估性能:在多个基准数据集(NSL-KDD、CTU13、PenDigits等)上的ROC AUC和PR AUC。
实验结果
研究问题
- RQ1基于自编码器的潜在空间数据增强是否能提升无监督异常检测中一类分类器的性能?
- RQ2与SMOTE和ADASYN等传统方法相比,基于AE的数据增强在异常检测AUC得分方面表现如何?
- RQ3在高维稀疏数据集上,该方法是否仍具备鲁棒性,其中特征稀疏性会挑战表示学习?
- RQ4与基于噪声的增强或基线OCC相比,性能提升是否具有统计显著性?
主要发现
- 在NSL-KDD和CTU13数据集上,所提AE-based数据增强方法优于SMOTE和ADASYN,多数情况下实现了最高的PR AUC和ROC AUC。
- 在PenDigits数据集上,该方法生成的LOF得分方差显著低于其他增强方法,表明其边界更加稳定和鲁棒。
- Wilcoxon符号秩检验确认,所提方法与基于噪声的增强在LOF得分上的差异具有统计显著性(p < 0.05)。
- 在高维稀疏的InternetAds数据集(1558个特征)上,该方法仍表现具有竞争力,尽管与其他数据集相比提升幅度较小,表明其对特征稀疏性具有一定敏感性。
- 在NSL-KDD的U2R子集上,该方法取得了第二名的ROC AUC,仅以0.044 AUC点落后于基于噪声的增强方法。
- 在单类异常数据集(如PenDigits、Spambase、Arrhythmia)上,基于AE的增强方法始终优于或匹配当前最先进方法,尤其在PR AUC方面表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。