Skip to main content
QUICK REVIEW

[論文レビュー] Tuneful: An Online Significance-Aware Configuration Tuner for Big Data Analytics

Ayat Fekry, Lucian Carata|arXiv (Cornell University)|Jan 22, 2020
Cloud Computing and Resource Management被引用数 11
ひとこと要約

Tuneful は、大規模データシステムのためのオンラインで重要度を考慮した設定チューナーであり、インクリメンタル感度分析とベイズ最適化を組み合わせることで、最小限のランタイムオーヘッドで近似的に最適な Spark 設定を特定する。最新の手法と比較して、中央値の探索時間を 62% 減少させ、動的ワークロードにおける高速でコスト効率の良いチューニングを可能にする。

ABSTRACT

Distributed analytics engines such as Spark are a common choice for processing extremely large datasets. However, finding good configurations for these systems remains challenging, with each workload potentially requiring a different setup to run optimally. Using suboptimal configurations incurs significant extra runtime costs. %Furthermore, Spark and similar platforms are gaining traction within data-scientists communities where awareness of such issues is relatively low. We propose Tuneful, an approach that efficiently tunes the configuration of in-memory cluster computing systems. Tuneful combines incremental Sensitivity Analysis and Bayesian optimization to identify near-optimal configurations from a high-dimensional search space, using a small number of executions. This setup allows the tuning to be done online, without any previous training. Our experimental results show that Tuneful reduces the search time for finding close-to-optimal configurations by 62\\% (at the median) when compared to existing state-of-the-art techniques. This means that the amortization of the tuning cost happens significantly faster, enabling practical tuning for new classes of workloads.

研究の動機と目的

  • 高次元の Spark 設定空間におけるワークロード固有の最適設定を特定する課題に対処すること。
  • Spark のような分散主記憶型システムにおける設定チューニングに要するコストと時間を削減すること。
  • 事前学習済みモデルや広範なオフライン学習に依存せずに、進化するワークロードに対する実用的でオンラインでの再チューニングを可能にすること。
  • 従来のインクリメンタル探索やモデルベースの手法よりも、近似的に最適な設定への収束を高速化すること。
  • 高性能な設定を特定するために必要な高価なワークロード実行回数を最小限に抑えること。

提案手法

  • 少数の実行回数で十分な感度分析を用いて、高次元空間から最も影響力のある設定パラメータを動的に同定する。
  • ガウス過程を用いたベイズ最適化を採用し、顕著なパラメータのみを効率的に探索・最適化する。
  • 実際のワークロード実行結果を用いて設定選択をガイドすることで、事前学習が不要なモデルフリーでオンラインチューニングを実現する。
  • ランタイムコストを最小限に抑えるために、探索と活用のバランスを取る確率的アセスメント関数を維持する。
  • 定期的なワークロード実行中に設定を監視・チューニングできるように、Spark にシームレスに統合する。
  • 各実行後のワークロードフィードバックを活用して、探索空間を精緻化し、段階的にチューニングの正確性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1少数の実行回数で、高次元的かつ動的変化する Spark 設定空間において、感度分析を効果的に用いて最も影響力のある設定パラメータを同定できるか?
  • RQ2インクリメンタル感度分析とベイズ最適化を組み合わせることで、従来のチューニング手法と比較して収束速度がどのように向上するか?
  • RQ3オンラインでモデルフリーな設定チューニングは、大規模データシステムにおける最適化の平均化コストをどの程度低減できるか?
  • RQ4Tuneful は、はるかに少ない実行サンプル数で、最新の手法と同等またはそれ以上の設定を達成できるか?
  • RQ5データ量の変化や環境の変化によって進化するワークロードに対して、Tuneful は頻繁な再チューニングをどの程度効果的に可能にするか?

主な発見

  • Tuneful は、最新の手法と比較して、近似的に最適な設定を特定するための中央値の探索時間を 62% 削減した。
  • 最良のシナリオでは、Tuneful は既存の手法と比較して探索時間を 97% 削減し、コストの平均化を著しく加速した。
  • Tuneful は、はるかに少ない実行回数で、最新の手法が得られるのと同等の実行時パフォーマンスを実現した。
  • わずかな初期実行回数で、ワークロード固有の顕著なパラメータを高い正確性で同定でき、効率的な探索空間の縮小が可能になった。
  • Tuneful は、進化するワークロードに対する実用的なオンライン再チューニングを可能にし、データ量や環境の変化に伴い設定を再最適化することが現実的になった。
  • 感度分析とベイズ最適化の統合により、高次元の設定空間においてデータ効率の良いチューニングが可能となり、従来のモデルベース手法や網羅的探索手法に比べ、顕著な前進を遂げた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。