Skip to main content
QUICK REVIEW

[论文解读] BDGS: A Scalable Big Data Generator Suite in Big Data Benchmarking

Zijian Ming, Chunjie Luo|arXiv (Cornell University)|Jan 22, 2014
Data Quality and Management参考文献 19被引用 12
一句话总结

BDGS 是一个可扩展的大数据生成工具套件,旨在通过利用现实世界的数据模型,生成保留大数据四大特征(体量、速度、多样性、真实性)的合成数据。它支持文本、图和表格等多种数据源的结构化、半结构化和非结构化数据,实现数据生成时间的线性可扩展性,并在不同工作负载下保持一致的高速生成速率(例如,文本为 71.3 MB/s,图数据为 591,684 条边/秒)。

ABSTRACT

Data generation is a key issue in big data benchmarking that aims to generate application-specific data sets to meet the 4V requirements of big data. Specifically, big data generators need to generate scalable data (Volume) of different types (Variety) under controllable generation rates (Velocity) while keeping the important characteristics of raw data (Veracity). This gives rise to various new challenges about how we design generators efficiently and successfully. To date, most existing techniques can only generate limited types of data and support specific big data systems such as Hadoop. Hence we develop a tool, called Big Data Generator Suite (BDGS), to efficiently generate scalable big data while employing data models derived from real data to preserve data veracity. The effectiveness of BDGS is demonstrated by developing six data generators covering three representative data types (structured, semi-structured and unstructured) and three data sources (text, graph, and table data).

研究动机与目标

  • 为解决生成具有应用特性的、可扩展的大数据并保留真实数据特征以用于基准测试的挑战。
  • 克服现有生成工具仅支持特定数据类型或平台(如 Hadoop)的局限性。
  • 在保持数据真实性的前提下,灵活控制数据体量和速度,通过现实世界数据建模实现。
  • 支持搜索引擎、电子商务和社交网络等不同领域的大数据工作负载。
  • 提供模块化、可扩展的框架,用于生成反映真实数据统计和结构特性的合成数据。

提出的方法

  • 基于来自文本、图和表格数据源的真实世界数据集,设计六种数据生成器,以确保数据的真实性。
  • 实施并行生成策略,根据硬件容量和执行时间扩展数据体量和速度。
  • 使用从真实数据中提取的统计模型,以保留分布、结构和关系等关键特征。
  • 集成数据格式转换工具,支持与 Hadoop 和 Spark 等主流大数据系统的互操作性。
  • 优化内存使用和并行处理,以在不同数据类型和数据量下保持一致的生成速率。
  • 将生成器套件嵌入开源 BigDataBench 框架中,以实现广泛的可访问性和系统集成。

实验结果

研究问题

  • RQ1如何设计一个大数据生成工具套件,以保留真实大数据的 4V 特性(体量、速度、多样性、真实性)?
  • RQ2哪些技术能够实现在多种数据类型(结构化、半结构化、非结构化)和数据源(文本、图、表格)上的可扩展、高性能数据生成?
  • RQ3随着数据体量增加,合成数据生成能否保持一致的性能速率?
  • RQ4内存使用如何影响数据生成性能?不同生成器类型中的性能瓶颈是什么?
  • RQ5同一生成器是否能在大数据基准测试的多个工作负载中有效复用?

主要发现

  • BDGS 套件在数据体量增加时表现出线性总体时间性能,证明了所有生成器类型的可扩展性。
  • 文本生成器在生成亚马逊电影评论时的平均生成速率为 71.3 MB/s,在生成维基百科数据时为 63.23 MB/s,具体取决于词典大小。
  • 图生成器在内存充足时可保持最低 591,684 条边/秒的速率,但由于内存需求高,其速度最慢。
  • 表生成器的生成速率为 23.85 MB/s,并且随着数据量增大,效率提升,因为单位数据的平均配置时间减少。
  • 实验中内存使用率超过 90%,表明内存是主要性能瓶颈,尤其对文本和图生成器影响显著。
  • 不同数据类型和数据量下,数据生成速率基本保持恒定,证实了系统的稳定性和可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。