Skip to main content
QUICK REVIEW

[论文解读] Identifying Dwarfs Workloads in Big Data Analytics

Wanling Gao, Chunjie Luo|arXiv (Cornell University)|May 26, 2015
Cloud Computing and Resource Management参考文献 18被引用 4
一句话总结

该论文通过针对搜索、社交网络、电子商务、生物信息学、多媒体和天文学等六大领域的40个代表性算法的多领域分析,识别出大数据分析中的八个基础计算模式——线性代数、采样、逻辑操作、转换操作、集合操作、图操作、统计操作和排序。通过抽象这些领域中反复出现的计算模式,作者建立了一个最小化且具有代表性的基准测试套件,可实现对大数据系统的高效、全面评估。

ABSTRACT

Big data benchmarking is particularly important and provides applicable yardsticks for evaluating booming big data systems. However, wide coverage and great complexity of big data computing impose big challenges on big data benchmarking. How can we construct a benchmark suite using a minimum set of units of computation to represent diversity of big data analytics workloads? Big data dwarfs are abstractions of extracting frequently appearing operations in big data computing. One dwarf represents one unit of computation, and big data workloads are decomposed into one or more dwarfs. Furthermore, dwarfs workloads rather than vast real workloads are more cost-efficient and representative to evaluate big data systems. In this paper, we extensively investigate six most important or emerging application domains i.e. search engine, social network, e-commerce, multimedia, bioinformatics and astronomy. After analyzing forty representative algorithms, we single out eight dwarfs workloads in big data analytics other than OLAP, which are linear algebra, sampling, logic operations, transform operations, set operations, graph operations, statistic operations and sort.

研究动机与目标

  • 为应对在计算单元最小化且具有代表性的情况下,对多样化、复杂且快速演进的大数据工作负载进行基准测试的挑战。
  • 识别出一组最小化的计算抽象(即基础计算模式),以捕捉主要大数据应用领域中的核心操作。
  • 开发一种系统化方法,从真实世界算法和框架中提取频繁出现的计算模式。
  • 基于这些基础计算模式,创建一个具有代表性的、成本效益高的基准测试套件(BigDataBench 3.1),用于评估大数据系统。
  • 为大数据分析中的系统评估、架构设计和性能优化提供基础支持。

提出的方法

  • 基于覆盖范围和相关性,选取了六大关键应用领域:搜索引擎、社交网络、电子商务、多媒体、生物信息学和天文学。
  • 分析了来自广泛使用库(如Mahout、MLlib)、框架(如Spark、Hadoop)和基准测试(如BigBench、AMP Benchmark)的40个代表性算法。
  • 通过分解算法并识别在多种数据模型(结构化、半结构化、非结构化)中反复出现的计算操作,提取出频繁出现的计算操作。
  • 采用类似有向无环图(DAG)的模型表示工作负载,其中顶点表示数据子集,边表示基础计算模式,以验证其可组合性和覆盖范围。
  • 通过组合基础计算模式操作,成功重构原始40个算法,验证了这八个基础计算模式的有效性。
  • 开发了BigDataBench 3.1作为开源基准测试套件,包含14个真实世界数据集和33个工作负载,均基于所识别的基础计算模式构建。

实验结果

研究问题

  • RQ1在多样化的大数据分析工作负载中,最频繁出现的基本计算单元是什么?
  • RQ2如何从真实世界算法和框架中系统性地推导出一组最小化的计算抽象(即基础计算模式)?
  • RQ3所识别出的基础计算模式在多大程度上能够代表跨多个领域的计算多样性?
  • RQ4与NRC七大核心模式等高层抽象相比,所提出的模式在粒度和代表性方面有何差异?
  • RQ5基于这些基础计算模式的基准测试套件,是否能够有效且高效地评估大数据系统,而无需依赖完整规模的复杂工作负载?

主要发现

  • 作者在大数据分析中识别出八个核心基础计算模式:线性代数、采样、逻辑操作、转换操作、集合操作、图操作、统计操作和排序。
  • 这些基础计算模式基于对六大主要应用领域中40个代表性算法的全面分析,确保了广泛的覆盖范围和代表性。
  • 这些基础计算模式可通过类似DAG的组合模型重构原始40个算法,证明了其表达能力和完备性。
  • 与NRC七大核心模式相比,这些基础计算模式处于更低的抽象层次,聚焦于原子计算单元而非高层数学问题,从而支持更细粒度的系统评估。
  • 所提出的模式涵盖了机器学习、数据挖掘、自然语言处理和图处理中的关键操作,包括优化、相似性搜索和概率推理的核心组件。
  • 由此产生的BigDataBench 3.1基准测试套件(公开可用)包含14个真实数据集和33个工作负载,所有内容均基于所识别的基础计算模式构建,提供了一个可扩展且具有代表性的评估框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。