Skip to main content
QUICK REVIEW

[论文解读] MalStone: Towards A Benchmark for Analytics on Large Data Clouds

Collin Bennett, Robert L. Grossman|arXiv (Cornell University)|Jul 7, 2010
Cloud Computing and Resource Management参考文献 6被引用 7
一句话总结

MalStone 引入了一项新颖的基准测试,用于评估云中间件在数据密集型分析工作负载中的性能,特别针对大规模日志数据上移动窗口比率的计算。它补充了 MalGen——一个用于生成合成日志文件的开源数据生成器,并展示了 Hadoop、Sector 和 Hadoop Streams 实现之间高达 20 倍的性能差异,凸显了体系结构对分析工作负载的影响。

ABSTRACT

Developing data mining algorithms that are suitable for cloud computing platforms is currently an active area of research, as is developing cloud computing platforms appropriate for data mining. Currently, the most common benchmark for cloud computing is the Terasort (and related) benchmarks. Although the Terasort Benchmark is quite useful, it was not designed for data mining per se. In this paper, we introduce a benchmark called MalStone that is specifically designed to measure the performance of cloud computing middleware that supports the type of data intensive computing common when building data mining models. We also introduce MalGen, which is a utility for generating data on clouds that can be used with MalStone.

研究动机与目标

  • 为解决在数据挖掘和分析工作负载中缺乏标准化基准测试以评估云中间件的问题。
  • 实现对大规模数据云系统在可扩展性和分析任务性能方面进行公平比较。
  • 提供一个专为真实、大规模分析工作负载定制的合成数据生成器(MalGen)。
  • 证明中间件选择对分布式分析性能具有显著影响,即使对于看似简单的统计计算也是如此。
  • 为未来聚焦于云环境中数据挖掘和特征工程的基准测试奠定基础。

提出的方法

  • MalStone 定义了一种风格化的分析计算:在时间上计算每个站点上标记实体的移动窗口比率 ρj,t。
  • 该基准测试采用 Site-Entity-Mark 模型,其中日志记录追踪实体访问站点的情况,后续的标记表示潜在的兴趣来源。
  • MalGen 生成可配置规模的合成日志文件(例如,100 亿条 100 字节的记录),以模拟真实世界的数据量。
  • 实现使用 Hadoop、Hadoop Streams 和 Sector 中间件处理日志数据并计算 MalStone 统计量。
  • 该基准测试通过在具有不同中间件堆栈的分布式集群上测量端到端执行时间来评估性能。
  • 实验在拥有超过 100 个节点和 PB 级数据的集群上,对比了三种中间件堆栈——Hadoop、Hadoop Streams 和 Sector。

实验结果

研究问题

  • RQ1当在大规模数据上执行代表性数据挖掘分析时,不同云中间件堆栈的性能如何比较?
  • RQ2在云分析中,Hadoop Streams 在某些统计计算上能否显著优于传统的 MapReduce?
  • RQ3像 MalGen 这样的合成数据生成器能否生成适合用于基准测试云分析平台的真实、大规模数据集?
  • RQ4导致云中间件在分析任务中出现显著性能差异的体系结构和实现因素有哪些?
  • RQ5MalStone 基准测试如何捕捉真实世界数据挖掘工作负载的复杂性,而不仅仅是简单的排序或聚合?

主要发现

  • MalStone 在对大规模数据计算相同分析统计量时,揭示了不同云中间件堆栈之间高达 20 倍的性能差异。
  • Hadoop Streams 在计算 MalStone 统计量方面优于传统 MapReduce,表明通过流式处理的轻量级脚本比完整的 MapReduce 流程更高效。
  • 通过 Hadoop Streams 使用 Python 程序实现,计算移动窗口比率 ρj,t 的速度优于等效的 MapReduce 实现。
  • MalGen 在拥有超过 100 个节点的集群上成功生成了数百亿条合成日志记录,使大规模数据云系统的现实基准测试成为可能。
  • 支撑 MalStone 的 Site-Entity-Mark 模型抽象具有通用性,可表示其他真实世界分析问题,如时间序列中的变化检测。
  • 该基准测试表明,即使对于看似简单的分析任务,中间件设计也对性能有显著影响,强调了针对应用特性的评估的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。