[論文レビュー] Learning-based Automatic Parameter Tuning for Big Data Analytics Frameworks
本論文では、時間制約の中で高次元パラメータ空間におけるサンプリングの制限を克服するため、より小規模なテストベッドを用いてより多くのトレーニングサンプルを生成し、予測モデルの精度を向上させる学習ベースの自動パラメータチューニングシステムAutoTuneを提案する。Latin hypercube samplingと複数のバウンダリー・アンド・サーチを組み合わせて、高次元パラメータ空間を探索し、Sparkワークロードにおいてデフォルト設定比で平均63.70%の改善、最先端手法比で6%-23%の改善を達成した。
Big data analytics frameworks (BDAFs) have been widely used for data processing applications. These frameworks provide a large number of configuration parameters to users, which leads to a tuning issue that overwhelms users. To address this issue, many automatic tuning approaches have been proposed. However, it remains a critical challenge to generate enough samples in a high-dimensional parameter space within a time constraint. In this paper, we present AutoTune--an automatic parameter tuning system that aims to optimize application execution time on BDAFs. AutoTune first constructs a smaller-scale testbed from the production system so that it can generate more samples, and thus train a better prediction model, under a given time constraint. Furthermore, the AutoTune algorithm produces a set of samples that can provide a wide coverage over the high-dimensional parameter space, and searches for more promising configurations using the trained prediction model. AutoTune is implemented and evaluated using the Spark framework and HiBench benchmark deployed on a public cloud. Extensive experimental results illustrate that AutoTune improves on default configurations by 63.70% on average, and on the five state-of-the-art tuning algorithms by 6%-23%.
研究の動機と目的
- 時間制約下でのビッグデータ分析フレームワーク(BDAF)チューニングにおける、高次元パラメータ空間におけるサンプリングの制限を解決すること。
- 生産環境システムの動作を模倣する小規模なテストベッドを用いることで、パフォーマンス最適化のための予測モデルの精度を向上させること。
- パラメータ空間における探索と活用のバランスを取る効率的な探索アルゴリズムの開発。
- Sparkワークロードにおける実行時間短縮の観点から、デフォルト設定および既存のチューニングアルゴリズムを上回ること。
- 実世界のビッグデータアプリケーションにおける実用的で自動的かつスケーラブルなパラメータチューニングの実現。
提案手法
- 生産環境システムから小規模なテストベッドを構築し、トレーニングサンプルの生成を高速化しながら、パフォーマンス変動特性を保持する。
- 高次元パラメータ空間全体にわたり多様で均等に分布するサンプルを生成するために、ラテンハイパーキューブサンプリング(LHS)を用いる。
- テストベッド上でランダムフォレストベースのパフォーマンス予測モデルを訓練し、異なる設定におけるアプリケーション実行時間を推定する。
- 予測モデルが特定した有望な設定の周囲で、複数のバウンダリー・アンド・サーチを繰り返し適用して、探索空間を段階的に精錬する。
- チューニングの効率を最大化するために、テストベッドでのトレーニング、探索、および生産環境での最終検証の時間割りを最適化する。
- テストベッドと生産環境システムのワークフローを統合し、固定時間予算内で最良の設定を検証および選択する。
実験結果
リサーチクエスチョン
- RQ1より小規模なテストベッドは、生産環境システムの動作を模倣しながら、パラメータ設定間のパフォーランス変動を効果的に捉えることができるか?
- RQ2ラテンハイパーキューブサンプリングのようなサンプリング戦略は、高次元パラメータ空間におけるカバレッジと効率をどのように向上させることができるか?
- RQ3学習ベースの予測モデルとバウンダリー・アンド・サーチを組み合わせることで、BDAF設定におけるランダムまたはヒューリスティックベースのチューニングをどれほど上回ることができるか?
- RQ4AutoTuneフレームワークは、デフォルト設定および既存の最先端チューニングアルゴリズムと比較して、どの程度のパフォーマンス向上を達成するか?
- RQ5時間制約下での自動パラメータチューニングにおいて、探索、活用、検証の時間割りにはどのようなトレードオフがあるか?
主な発見
- AutoTuneは、HiBenchベンチマークのSparkワークロードにおいて、デフォルト設定比で平均63.70%の実行時間短縮を達成した。
- AutoTuneは、BestConfig、RFHOC、Hyperopt、SMAC、Randomの5つの最先端チューニングアルゴリズムと比較して、6%から23%の改善を達成した。
- WordCount、PageRank、GBTを含む7つの多様なビッグデータアプリケーションにおいて、安定的かつ顕著なパフォーマンス向上を示した。
- ランダムサーチは予想に反して優れた性能を示したが、AutoTuneは平均して7.35%優れており、学習と探索戦略の有効性を裏付けた。
- テストベッドの活用により、直接生産環境でのチューニングに比べてサンプル生成が100倍以上高速化され、時間制限内でのより良いモデルトレーニングが可能になった。
- 複数のバウンダリー・アンド・サーチ機構は、高性能な設定の周囲で探索空間を効果的に狭め、収束性と効率性を向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。