Skip to main content
QUICK REVIEW

[论文解读] SCADS: A Scalable Approach Using Spark in Cloud for Host-based Intrusion Detection System with System Calls

Ming Liu, Zhi Xue|arXiv (Cornell University)|Sep 24, 2021
Network Security and Intrusion Detection参考文献 47被引用 5
一句话总结

本文提出 SCADS,一种可扩展的基于主机的入侵检测系统,利用 Google Cloud 上的 Apache Spark 处理由 Linux 应用程序生成的大规模系统调用轨迹。通过在 Spark 集群上分布计算,并使用 n-gram 特征提取结合 TF-IDF 加权,SCADS 实现了高检测准确率和线性可扩展性,在处理大规模数据工作负载时,其效率和适应性优于传统单主机方法。

ABSTRACT

Following the current big data trend, the scale of real-time system call traces generated by Linux applications in a contemporary data center may increase excessively. Due to the deficiency of scalability, it is challenging for traditional host-based intrusion detection systems deployed on every single host to collect, maintain, and manipulate those large-scale accumulated system call traces. It is inflexible to build data mining models on one physical host that has static computing capability and limited storage capacity. To address this issue, we propose SCADS, a corresponding solution using Apache Spark in the Google cloud environment. A set of Spark algorithms are developed to achieve the computational scalability. The experiment results demonstrate that the efficiency of intrusion detection can be enhanced, which indicates that the proposed method can apply to the design of next-generation host-based intrusion detection systems with system calls.

研究动机与目标

  • 解决传统基于主机的入侵检测系统(HIDS)在现代数据中心处理大规模系统调用轨迹时面临的可扩展性限制。
  • 通过利用基于云的分布式计算,克服单主机系统在计算和存储方面的瓶颈。
  • 设计一种可扩展的框架,将 Apache Spark 与云基础设施集成,以提升基于系统调用的 HIDS 的实时检测效率。
  • 使用真实世界系统调用轨迹和标准机器学习分类器,评估所提出框架的性能和可扩展性。

提出的方法

  • 在 Google Cloud 上使用 Apache Spark 部署分布式计算框架,以处理来自多个虚拟机的大规模系统调用轨迹。
  • 实现一种多长度 n-gram 特征提取方法,用于表示系统调用序列,以捕捉短程和远程的行为模式。
  • 利用 Spark 的 IDF 模型对 TF-IDF 进行向量化处理,通过减少对频繁但无区分性的系统调用的过拟合,改善特征表示并提升检测准确率。
  • 使用分布式机器学习分类器(特别是 LR-LBFGS 和 SVM)在 Spark 执行器上进行训练和执行,以实现并行处理。
  • 通过 Dataproc API 动态扩展 Spark 集群,以评估在不同计算负载下的横向可扩展性和性能。
  • 使用最大 n-gram 长度为 1、6 和 10 的多长度 n-gram 方法,评估序列长度对检测性能的影响。

实验结果

研究问题

  • RQ1基于云的、原生 Spark 的框架能否有效扩展大规模系统调用轨迹的处理,以支持基于主机的入侵检测?
  • RQ2在分布式环境中,n-gram 长度的选择(单长度 vs. 多长度)如何影响检测准确率?
  • RQ3与原始词频相比,TF-IDF 特征加权在基于系统调用的 HIDS 中在多大程度上提升了检测性能?
  • RQ4当在 Spark 集群上分布执行时,不同分类器(LR-LBFGS 与 SVM)在准确率和执行时间方面的表现如何?
  • RQ5随着 Spark 执行器数量的增加,所提出框架的可扩展性如何?

主要发现

  • 在使用 LR-LBFGS 分类器时,多长度 n-gram 方法在检测准确率上优于单长度 n-gram 方法,尤其当 n 值在 1 到 10 之间时表现更优。
  • 使用 Spark IDF 模型调整后的 TF-IDF 特征向量相比原始 TF 向量显著提升了检测准确率,后者表现出不稳定的性能。
  • 当最大 n-gram 长度设为 10 时,LR-LBFGS 分类器的 AUC 值高于 SVM 分类器,表明其在处理较长系统调用序列时具有更好的泛化能力。
  • 当最大 n-gram 长度超过 5(LR-LBFGS)和 3(SVM)时,AUC 值趋于平稳,表明在此阈值之后收益递减。
  • 随着执行器数量从 1 增加到 6,Spark 执行器的平均任务时间显著减少,表明 SCADS 框架具有强大的线性可扩展性。
  • 该框架实现了可接受的可扩展性和性能,当处理较长的 n-gram 序列(n=10)时,LR-LBFGS 分类器比 SVM 更高效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。