Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Resource Allocation for Serverless Queries

Anish Pimpley, Shuo Li|arXiv (Cornell University)|Jul 19, 2021
Cloud Computing and Resource Management参考文献 23被引用数 11
ひとこと要約

本論文では、1回のクエリ実行から合成リソース-パフォーマンスデータを生成する新しいシミュレータ(AREPAS)を用いて、サーバーヲス分析クエリのパフォーマンス特性曲線(PCC)を予測する機械学習システムTASQを提案する。PCCを単調かつ指数関数的に減少する曲線としてモデル化し、制約付き損失関数を用いたグラフニューラルネットワーク(GNN)を活用することで、リソース割り当ての範囲にわたるクエリ実行時間の点予測およびトレンド予測を高精度で実現し、観測済みおよび新しいクエリの両方で予測誤差が22%未満の中央値を達成した。

ABSTRACT

Optimizing resource allocation for analytical workloads is vital for reducing costs of cloud-data services. At the same time, it is incredibly hard for users to allocate resources per query in serverless processing systems, and they frequently misallocate by orders of magnitude. Unfortunately, prior work focused on predicting peak allocation while ignoring aggressive trade-offs between resource allocation and run-time. Additionally, these methods fail to predict allocation for queries that have not been observed in the past. In this paper, we tackle both these problems. We introduce a system for optimal resource allocation that can predict performance with aggressive trade-offs, for both new and past observed queries. We introduce the notion of a performance characteristic curve (PCC) as a parameterized representation that can compactly capture the relationship between resources and performance. To tackle training data sparsity, we introduce a novel data augmentation technique to efficiently synthesize the entire PCC using a single run of the query. Lastly, we demonstrate the advantages of a constrained loss function coupled with GNNs, over traditional ML methods, for capturing the domain specific behavior through an extensive experimental evaluation over SCOPE big data workloads at Microsoft.

研究の動機と目的

  • サーバーヲスクエリシステムにおけるリソース割り当ての非効率性という課題に対処すること。ユーザーはしばしばリソースを桁違いに誤って割り当てがちである。
  • 履歴実行データのない新しいまたは一時的なクエリに対しても、リソース割り当ての範囲にわたるクエリパフォーマンスの正確な予測を可能にすること。
  • リソース割り当ての増加に伴うパフォーマンスの逓減効果を、コンactでパrameterizedされたパフォーマンス特性曲線(PCC)でモデル化すること。
  • AREPASシミュレータを用いて1回のクエリ実行からリソース-パフォーマンスのスカイラインを合成することで、トレーニングにおけるデータスパarsityを克服すること。
  • 単調性などのドメイン固有の制約を組み込み、グラフニューラルネットワーク(GNN)と制約付き損失関数を用いることで、従来のML手法よりも精度を向上させること。

提案手法

  • リソース割り当てとクエリ実行時間のトレードオフをモデル化するため、パラメータ化された単調減少関数としてパフォーマンス特性曲線(PCC)を導入する。
  • 異なるトークン数でのリソース割り当てをエミュレートすることで、1回のクエリ実行から完全なPCCを生成する、新しいデータ拡張シミュレータAREPASを開発する。
  • 2つのパラメータを有するべき乗則の減衰関数を用いてPCCをモデル化し、単調性とユーザーにとっての解釈可能性を保証する。
  • ドメイン固有の関係を複雑に捉えるために、制約付き損失関数を用いたグラフニューラルネットワーク(GNN)を採用し、標準的なMLモデルを上回る性能を実現する。
  • 実際の履歴データとAREPASからの合成データの両方を用いてモデルをトレーニングし、未観測のクエリに対する一般化性能を向上させる。
  • 予測の単調性を強制する制約付き損失関数を用いることで、モデルの信頼性と現実のパフォーマンストレンドとの整合性を向上させる。

実験結果

リサーチクエスチョン

  • RQ11回のクエリ実行に基づくシミュレーション(AREPAS)が、トレーニング用に現実的で信頼性のあるパフォーマンススカイラインを合成するのにどの程度有効であるか。
  • RQ2制約付き損失関数とGNNが、従来のMLモデルと比較して、リソース割り当ての逓減効果をモデル化する際の予測精度をどの程度向上させるか。
  • RQ3点予測(特定のリソース割り当て)とトレンド予測(全範囲の割り当て)の両方において、モデルのパフォーマンスはどのように変動するか。
  • RQ4GNNと単純なニューラルネットワークを比較した場合、モデルの精度、推論速度、計算コストのトレードオフはどのようになるか。
  • RQ5観測済みでないクエリの範囲において、幅広いリソース割り当てにおけるクエリ実行時間の予測が、正確に行えるか。

主な発見

  • TASQは、真値データにおける実行時間予測で中央絶対誤差(MAE)が33%を達成し、XGBoost(53% MAE)を著しく上回り、完全な履歴データでトレーニングされたモデルと同等の性能を示した。
  • 制約付き損失関数を用いたGNNモデルは、全クエリにわたるトレンド予測で22%の中央誤差を達成し、未観測ワークロードへの一般化性能が優れていた。
  • AREPASは効果的なデータ拡張を可能にした。1クエリあたり1回の実行データのみでトレーニングされたモデルも、完全な履歴データでトレーニングされたモデルと同等の性能を達成した。
  • 制約付き損失関数を用いたGNNモデルは、点予測およびトレンド予測の両方でXGBoostおよび標準的なニューラルネットワークを上回り、実行時間予測ではMAEが1.5倍低く、曲線パラメータ予測では2倍低かった。
  • 制約付き損失関数により、単調性が強制されることでモデルの信頼性が向上し、現実のパフォーマンストレンドと整合し、ユーザーの解釈可能性も向上した。
  • 本システムにより、ユーザーはパフォーマンスとリソース使用量の間で情報に基づいた妥当なトレードオフを取ることができ、92%のジョブでトークン使用量を最大50%削減しつつ、パフォーマンス低下をたった5%に抑えることが可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。