Skip to main content
QUICK REVIEW

[论文解读] DV-ARPA: Data Variety Aware Resource Provisioning for Big Data Processing in Accumulative Applications

Hossein Ahmadvand, Fouzhan Foroutan|arXiv (Cornell University)|Aug 11, 2020
Cloud Computing and Resource Management参考文献 14被引用 11
一句话总结

DV-ARPA 提出了一种针对累积型应用中大数据工作负载的数据多样性感知资源分配框架,通过基于采样分析得出的数据块重要性动态分配虚拟机(VM)。通过将 VM 类型与数据特征相匹配,与忽略数据多样性的方法相比,可将处理成本降低高达 35%。

ABSTRACT

In Cloud Computing, the resource provisioning approach used has a great impact on the processing cost, especially when it is used for Big Data processing. Due to data variety, the performance of virtual machines (VM) may differ based on the contents of the data blocks. Data variety-oblivious allocation causes a reduction in the performance of VMs and increases the processing cost. Thus, it is possible to reduce the total cost of the job by matching the VMs with the given data blocks. We use a data-variety-aware resource allocation approach to reduce the processing cost of the considered job. For this issue, we divide the input data into some data blocks. We define the significance of each data block and based on it we choose the appropriate VMs to reduce the cost. For detecting the significance of each data portion, we use a specific sampling method. This approach is applicable to accumulative applications. We use some well-known benchmarks and configured servers for our evaluations. Based on the results, our provisioning approach improves the processing cost, up to 35% compared to other approaches.

研究动机与目标

  • 为解决由于数据多样性影响虚拟机性能,导致云环境中的大数据工作负载处理成本过高的问题。
  • 通过将虚拟机类型与数据块特征相匹配,而非采用统一分配方式,降低资源分配的开销。
  • 通过分析数据多样性,提升累积型应用(数据被逐步处理)的成本效率。
  • 开发一种可扩展的数据多样性感知分配策略,适用于真实世界的大数据基准测试。
  • 证明基于重要性的虚拟机分配可带来云环境中可测量的成本降低。

提出的方法

  • 将输入的大数据划分为离散的数据块,以实现细粒度分析。
  • 应用特定的采样方法,基于数据块的内容和处理特征,估算其重要性。
  • 将数据块的重要性映射到合适的虚拟机类型,以优化性能与成本。
  • 使用综合考虑虚拟机类型、数据多样性及处理负载的成本模型,指导资源分配决策。
  • 采用知名的大数据基准测试工具和配置好的云服务器,在真实条件下评估该方法。
  • 实施一种基于反馈的资源分配机制,能够根据累积处理阶段中的数据多样性自适应调整。

实验结果

研究问题

  • RQ1数据多样性在大数据工作负载中如何影响虚拟机性能和处理成本?
  • RQ2基于数据块重要性的动态虚拟机分配能否降低整体处理成本?
  • RQ3在累积型应用中,数据多样性感知分配在多大程度上优于忽略数据多样的分配方式?
  • RQ4何种采样策略能够实现对数据块重要性的准确且高效的估计?
  • RQ5所提出的资源分配模型在多种大数据工作负载中具有多高的可扩展性和有效性?

主要发现

  • 与传统的、忽略数据多样性的资源分配策略相比,DV-ARPA 方法可将总处理成本降低高达 35%。
  • 数据多样性显著影响虚拟机性能,虚拟机类型不匹配会导致更高的处理成本。
  • 基于采样的重要性检测方法能有效识别出需要高性能虚拟机的数据块。
  • 在数据特征随时间演变的累积型工作负载中,成本降低效果最为显著。
  • 所提出的方法在多个基准测试工作负载中均保持了高效率和可扩展性。
  • 基于数据重要性的虚拟机分配可提升资源利用率,并降低大数据流水线中的延迟。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。