Skip to main content
QUICK REVIEW

[论文解读] Detecting fraudulent activity in a cloud using privacy-friendly data aggregates

Marc Solanas, Julio Hernández-Castro|arXiv (Cornell University)|Nov 25, 2014
Cloud Data Security Solutions参考文献 6被引用 7
一句话总结

本文提出了一种隐私友好的方法,仅使用 OpenStack Ceilometer 仪表数据中的计费级别数据聚合,来检测云环境中的欺诈行为。通过将随机森林分类器应用于 5 秒钟的资源使用快照(如 CPU 和网络使用情况),该方法能够以高准确率检测比特币挖矿、DDoS 攻击和 CPU 密集型工作负载等行为,实现在不进行侵入式监控的前提下实现早期预警。

ABSTRACT

More users and companies make use of cloud services every day. They all expect a perfect performance and any issue to remain transparent to them. This last statement is very challenging to perform. A user's activities in our cloud can affect the overall performance of our servers, having an impact on other resources. We can consider these kind of activities as fraudulent. They can be either illegal activities, such as launching a DDoS attack or just activities which are undesired by the cloud provider, such as Bitcoin mining, which uses substantial power, reduces the life of the hardware and can possibly slow down other user's activities. This article discusses a method to detect such activities by using non-intrusive, privacy-friendly data: billing data. We use OpenStack as an example with data provided by Telemetry, the component in charge of measuring resource usage for billing purposes. Results will be shown proving the efficiency of this method and ways to improve it will be provided as well as its advantages and disadvantages.

研究动机与目标

  • 在不损害用户隐私的前提下,检测 IaaS 云环境中的欺诈或资源滥用行为。
  • 利用现有的、非侵入性的计费数据(如 CPU、网络使用情况)进行异常检测,避免需要深度包检测。
  • 评估并比较机器学习分类器(尤其是随机森林)对五类不同工作负载类型(常规、Hadoop、CPU 密集型、DDoS 和加密货币挖矿)的分类性能。
  • 设计一个实时检测流水线,使用数据聚合作为第一道过滤器,减轻深层检测系统的工作负载。
  • 证明隐私保护型数据聚合能够有效识别可疑行为,同时保护用户隐私。

提出的方法

  • 从 OpenStack Ceilometer 仪表数据中收集每个虚拟机或存储卷的 5 秒钟资源使用聚合数据(CPU、网络、I/O)。
  • 使用标注了五类工作负载类型(常规、Hadoop、CPU 密集型、内部 DDoS 和比特币/莱特币挖矿)的样本训练随机森林分类器。
  • 采用基于阈值的决策机制来标记异常,其中阈值控制敏感度(例如,5–10% 的高置信度警报)。
  • 通过组合多个模型或时间窗口的预测结果,使用元分类器来提高检测准确率。
  • 通过处理每小时一批数据来模拟实时运行,假设每类工作负载各对应一个虚拟机,以简化评估。
  • 提出将分类功能直接集成到 Ceilometer 中,或通过 REST API 暴露,以实现在不同云平台上的部署。

实验结果

研究问题

  • RQ1来自云计费系统的隐私友好型数据聚合能否有效检测欺诈或滥用工作负载?
  • RQ2随机森林分类器在仅使用资源使用度量的情况下,对正常、CPU 密集型、DDoS 和加密货币挖矿工作负载的区分能力如何?
  • RQ3数据聚合对检测准确率有何影响?如何通过元分类器加以改进?
  • RQ4该方法能否在不修改底层云基础设施的前提下实现实时部署?
  • RQ5与传统入侵检测系统相比,该方法在隐私保护和性能方面表现如何?

主要发现

  • 仅使用 5 秒钟的资源使用聚合数据,随机森林分类器对所有五类工作负载类型均实现了高检测准确率。
  • 该方法成功区分了正常工作负载与资源密集型或恶意活动(如 DDoS 攻击和加密货币挖矿)。
  • 基于阈值的警报机制允许在灵敏度和误报率之间灵活调节,最优性能在 5–10% 的误报阈值下实现。
  • 使用数据聚合保护了用户隐私,避免了对应用层数据的详细检查,同时仍能实现有效的异常检测。
  • 该框架适合作为多层入侵检测流水线中的第一道过滤器,可减少对良性工作负载的深层检测需求。
  • 该方法可通过独立服务部署,或通过扩展 Ceilometer 实现,实现最小基础设施变更下的实时分类。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。