[论文解读] Hybrid Deep Learning Model using SPCAGAN Augmentation for Insider Threat Analysis
本文提出 SPCAGAN,一种混合深度学习模型,结合基于线性流形学习的生成对抗网络(GAN)与一种新型损失函数,用于生成高质量的合成内部威胁数据,解决了类别不平衡问题并提升了异常检测性能。该方法在基准数据集上优于当前最先进方法,SPCAGAN 有效缓解了模式崩溃问题,并提高了检测准确率。
Cyberattacks from within an organization's trusted entities are known as insider threats. Anomaly detection using deep learning requires comprehensive data, but insider threat data is not readily available due to confidentiality concerns of organizations. Therefore, there arises demand to generate synthetic data to explore enhanced approaches for threat analysis. We propose a linear manifold learning-based generative adversarial network, SPCAGAN, that takes input from heterogeneous data sources and adds a novel loss function to train the generator to produce high-quality data that closely resembles the original data distribution. Furthermore, we introduce a deep learning-based hybrid model for insider threat analysis. We provide extensive experiments for data synthesis, anomaly detection, adversarial robustness, and synthetic data quality analysis using benchmark datasets. In this context, empirical comparisons show that GAN-based oversampling is competitive with numerous typical oversampling regimes. For synthetic data generation, our SPCAGAN model overcame the problem of mode collapse and converged faster than previous GAN models. Results demonstrate that our proposed approach has a lower error, is more accurate, and generates substantially superior synthetic insider threat data than previous models.
研究动机与目标
- 解决由于真实世界数据有限而导致的内部威胁检测中类别不平衡的问题。
- 开发一种数据增强方法,生成多样化、高保真的合成内部威胁实例,以提升模型泛化能力。
- 通过混合贝叶斯神经网络(BNN)与基于 GAN 的训练,提升对抗鲁棒性与检测性能。
- 克服现有 GAN 在内部威胁数据合成中存在模式崩溃与收敛缓慢等局限性。
- 对合成数据质量与异常检测性能在基准数据集上进行系统性评估。
提出的方法
- 提出 SPCAGAN,一种改进的辅助分类器 GAN(ACGAN),引入基于线性流形学习的正则化,以提升生成器训练效果。
- 集成一种新型损失函数,促使生成器学习数据的内在流形结构,从而增强数据多样性与分布保真度。
- 采用线性内在维度估计方法,分析并引导生成器从异构数据源中学习真实数据分布。
- 通过合成数据进行对抗训练,提升模型对对抗样本的鲁棒性。
- 将 SPCAGAN 生成的数据与混合贝叶斯神经网络(BNN)结合,实现端到端的异常检测。
- 采用可视化技术(KDE、PCA、t-SNE)评估真实数据与合成数据分布之间的相似性。

实验结果
研究问题
- RQ1基于 GAN 的数据增强方法是否能在不依赖真实数据的前提下,有效缓解内部威胁检测中的类别不平衡问题?
- RQ2线性流形学习的引入在多大程度上提升了合成内部威胁数据的质量与多样性?
- RQ3SPCAGAN 在避免模式崩溃与加快收敛速度方面,相较于现有 GAN 模型表现如何?
- RQ4基于 SPCAGAN 生成数据训练的混合 BNN 模型是否在异常检测性能上优于当前最先进模型?
- RQ5从特征空间几何结构来看,合成数据分布与原始数据分布的匹配程度如何?
主要发现
- SPCAGAN 在 CERT v5.2 数据集上取得了 0.668 的最高 F1 分数,优于所有基线方法,包括 CGAN、WGAN-GP 和 ACGAN。
- 模型表现出更优的收敛速度,并成功消除了模式崩溃,t-SNE 可视化结果表明少数类内部威胁活动的聚类清晰分离。
- SPCAGAN 生成的合成数据与真实数据具有高度的分布相似性,KDE 与 PCA/t-SNE 可视化结果在多个特征上均得到验证。
- 基于 SPCAGAN 数据训练的混合 BNN 模型在 CERT v5.2 数据集上实现了 0.917 的宏平均 F1 分数,表明其在少数类上表现优异。
- 使用 SPCAGAN 生成数据进行对抗训练显著提升了模型鲁棒性,降低了对对抗扰动的敏感性。
- 所提方法在 CERT v5.2 数据集上取得了 3.868 的 F1 分数,显著优于现有方法,如 ACGAN(F1=0.621)与 WGAN-GP(F1=0.674)。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。