Skip to main content
QUICK REVIEW

[论文解读] C3O: Collaborative Cluster Configuration Optimization for Distributed Data Processing in Public Clouds

Jonathan Will, Lauritz Thamsen|arXiv (Cornell University)|Jul 28, 2021
Cloud Computing and Resource Management参考文献 24被引用 17
一句话总结

C3O 是一种协作式运行时预测系统,通过利用来自不同用户的共享历史执行数据,优化公共云中分布式数据处理的集群配置。它使用基于上下文的回归模型,这些模型基于全球分布的工作负载指标进行训练,在预测 930 个 Spark 作业的运行时间时,平均绝对误差低于 3%,显著优于单用户方法。

ABSTRACT

Distributed dataflow systems enable data-parallel processing of large datasets on clusters. Public cloud providers offer a large variety and quantity of resources that can be used for such clusters. Yet, selecting appropriate cloud resources for dataflow jobs - that neither lead to bottlenecks nor to low resource utilization - is often challenging, even for expert users such as data engineers. We present C3O, a collaborative system for optimizing data processing cluster configurations in public clouds based on shared historical runtime data. The shared data is utilized for predicting the runtimes of data processing jobs on different possible cluster configurations, using specialized regression models. These models take the diverse execution contexts of different users into account and exhibit mean absolute errors below 3% in our experimental evaluation with 930 unique Spark jobs.

研究动机与目标

  • 解决在不产生高配置或分析开销的情况下,为分布式数据处理作业选择最优云资源的挑战。
  • 通过共享来自不同执行环境的用户历史运行时数据,实现跨用户的协作式性能建模。
  • 开发一种运行时预测器,通过利用全球收集的、上下文感知的训练数据,提高预测准确性。
  • 减少公共云环境中间歇性数据处理工作负载的资源过度配置,提升成本效率。

提出的方法

  • C3O 收集并共享来自不同执行环境(包括不同数据大小、集群配置和工作负载)的用户历史运行时指标(如作业持续时间、资源使用情况)。
  • 它采用黑箱运行时预测模型,根据特定场景下的预期准确性,动态选择多个回归模型之一。
  • 系统使用交叉验证从可用训练数据中选择最具前景的模型,确保在各种配置下具有鲁棒性。
  • 预测器基于 930 个独立 Spark 作业的共享数据进行训练,整合了数据大小、分区数量和硬件特性等上下文特征。
  • 它支持协作和单用户两种模式,允许用户在有全局数据时受益于全局数据,必要时可回退到本地数据。
  • 该架构支持运行时动态模型切换,能够适应新配置并最小化预测误差。

实验结果

研究问题

  • RQ1来自不同用户的共享历史运行时数据是否能提升公共云中分布式数据处理作业运行时间预测的准确性?
  • RQ2协作式运行时预测器的性能与仅使用本地数据训练的单用户模型相比如何?
  • RQ3上下文感知回归模型在多大程度上能减少集群配置优化中的预测误差?
  • RQ4交叉验证和模型选择策略在异构执行环境中对预测准确性有何影响?

主要发现

  • C3O 预测器在预测 930 个独立 Spark 作业的运行时间时,平均绝对误差低于 3%,表现出极高的准确性。
  • 与仅使用本地数据训练的模型相比,使用全局共享数据进行协作训练显著提升了预测准确性。
  • 即使本地数据有限,系统仍能保持强劲性能,表明全局数据从一开始就增强了预测的可靠性。
  • 基于交叉验证的模型选择能有效识别出针对特定配置和上下文的最准确回归模型。
  • 该方法减少了对昂贵的分析运行和过度配置的需求,尤其在集群配置时间较长的云环境中具有显著优势。
  • 该系统在协作与非协作使用场景下均有效,支持具备或不具备共享数据访问能力的组织。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。