Skip to main content
QUICK REVIEW

[论文解读] Optimal Resource Allocation for Serverless Queries

Anish Pimpley, Shuo Li|arXiv (Cornell University)|Jul 19, 2021
Cloud Computing and Resource Management参考文献 23被引用 11
一句话总结

该论文提出 TASQ,一种机器学习系统,通过一种新型模拟器(AREPAS)从单次查询运行中合成资源-性能数据,以预测无服务器分析查询的性能特征曲线(PCC)。通过将 PCC 建模为单调递减的指数衰减曲线,并结合使用带有约束损失函数的图神经网络(GNN),TASQ 实现了对不同资源配置下查询运行时的准确点预测与趋势预测,对已观测及新查询的预测中,中位误差均低于 22%。

ABSTRACT

Optimizing resource allocation for analytical workloads is vital for reducing costs of cloud-data services. At the same time, it is incredibly hard for users to allocate resources per query in serverless processing systems, and they frequently misallocate by orders of magnitude. Unfortunately, prior work focused on predicting peak allocation while ignoring aggressive trade-offs between resource allocation and run-time. Additionally, these methods fail to predict allocation for queries that have not been observed in the past. In this paper, we tackle both these problems. We introduce a system for optimal resource allocation that can predict performance with aggressive trade-offs, for both new and past observed queries. We introduce the notion of a performance characteristic curve (PCC) as a parameterized representation that can compactly capture the relationship between resources and performance. To tackle training data sparsity, we introduce a novel data augmentation technique to efficiently synthesize the entire PCC using a single run of the query. Lastly, we demonstrate the advantages of a constrained loss function coupled with GNNs, over traditional ML methods, for capturing the domain specific behavior through an extensive experimental evaluation over SCOPE big data workloads at Microsoft.

研究动机与目标

  • 为解决无服务器查询系统中资源分配效率低下问题,用户常因资源配置错误而造成数量级偏差。
  • 实现对一系列资源配置下查询性能的准确预测,包括无历史执行数据的新查询或临时查询。
  • 使用紧凑的参数化性能特征曲线(PCC)建模资源配置对查询性能的边际收益递减效应。
  • 通过单次查询执行利用 AREPAS 模拟器合成真实资源-性能天际线,克服训练数据稀疏性问题。
  • 通过引入领域特定约束(如单调性)并使用带有约束损失函数的图神经网络(GNN),提升预测准确性,超越传统机器学习方法。

提出的方法

  • 提出性能特征曲线(PCC)作为参数化、单调递减函数,用于建模资源配置与查询运行时之间的权衡关系。
  • 开发 AREPAS,一种新型数据增强模拟器,通过在不同令牌数量下模拟资源配置,从单次查询运行中生成完整的 PCC。
  • 使用带有两个参数的幂律衰减函数建模 PCC,确保单调性并提升用户可解释性。
  • 采用带有约束损失函数的图神经网络(GNN),捕捉查询特征与性能之间的复杂领域特定关系,优于标准机器学习模型。
  • 使用真实历史数据与 AREPAS 生成的合成数据联合训练模型,提升对未见查询的泛化能力。
  • 采用约束损失函数,强制预测结果保持单调性,提升模型可靠性并使其与真实世界性能趋势保持一致。

实验结果

研究问题

  • RQ1机器学习模型能否在广泛资源配置范围内准确预测查询运行时间,即使面对此前未观测到的查询?
  • RQ2基于单次查询的模拟(AREPAS)在合成训练资源配置模型所需的真实性能天际线方面效果如何?
  • RQ3与传统机器学习模型相比,约束损失函数与 GNN 在建模资源配置边际收益递减效应方面,能多大程度上提升预测准确性?
  • RQ4模型在点预测(特定资源配置)与趋势预测(全部资源配置范围)中的表现有何差异?
  • RQ5在使用 GNN 与更简单的神经网络时,模型准确性、推理速度与计算成本之间的权衡如何?

主要发现

  • TASQ 在真实数据上的运行时间预测中,中位绝对误差(MAE)为 33%,显著优于 XGBoost(53% MAE),并达到使用完整历史数据训练模型的性能水平。
  • 采用约束损失函数的 GNN 模型在所有查询的趋势预测中实现 22% 的中位误差,展现出对未见工作负载的强大泛化能力。
  • AREPAS 实现了有效的数据增强:仅基于每查询一次真实运行的增强数据训练的模型,性能可与使用完整历史数据训练的模型相媲美。
  • 采用约束损失函数的 GNN 模型在点预测与趋势预测中均优于 XGBoost 与标准神经网络,运行时间 MAE 降低 1.5 倍,曲线参数 MAE 降低 2 倍。
  • 约束损失函数通过强制单调性提升模型可靠性,与真实世界性能趋势一致,增强用户可解释性。
  • 该系统使用户能够就性能与资源使用做出明智权衡,92% 的作业可将令牌使用量减少高达 50%,同时仅承受 5% 的性能损失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。