[論文レビュー] Support vector regression model for BigData systems
本稿では、シミュレーションベースのモデルの計算コストの問題を克服するために、機械学習を活用してBig DataシステムにおけるMapReduceジョブ実行時間を予測するためのサポートベクターレグRESSION(SVR)モデルを提案する。SVRは、ノイズが多いデータにおいても線形回帰を上回る性能を示し、コア数の逆数(1/nCores)を重要な特徴量として使用することで、最適な設定において相対誤差が10%未満の高い精度を達成する。
Nowadays Big Data are becoming more and more important. Many sectors of our economy are now guided by data-driven decision processes. Big Data and business intelligence applications are facilitated by the MapReduce programming model while, at infrastructural layer, cloud computing provides flexible and cost effective solutions for allocating on demand large clusters. In such systems, capacity allocation, which is the ability to optimally size minimal resources for achieve a certain level of performance, is a key challenge to enhance performance for MapReduce jobs and minimize cloud resource costs. In order to do so, one of the biggest challenge is to build an accurate performance model to estimate job execution time of MapReduce systems. Previous works applied simulation based models for modeling such systems. Although this approach can accurately describe the behavior of Big Data clusters, it is too computationally expensive and does not scale to large system. We try to overcome these issues by applying machine learning techniques. More precisely we focus on Support Vector Regression (SVR) which is intrinsically more robust w.r.t other techniques, like, e.g., neural networks, and less sensitive to outliers in the training set. To better investigate these benefits, we compare SVR to linear regression.
研究の動機と目的
- HadoopおよびTezシステムにおけるBig Dataジョブの実行時間を正確に予測する課題に対処すること。
- スケールが大きい場合にシミュレーションベースのパフォーマンスモデリングが計算的に非現実的であるという問題を克服すること。
- スケーラブルで正確なパフォーマンス予測のため、特に線形回帰とSVRを含む機械学習手法の評価を行うこと。
- クラスターサイズおよびジョブ特性の文脈において、SVRの最適な特徴量とカーネルタイプを特定すること。
- クラウドベースのBig Dataシステムにおけるコスト効率的で効率的な容量割り当てを可能にすること。
提案手法
- ジョブ実行時間をモデル化するために、線形、多項式(次数2および3)、ガウス型(RBF)カーネルを用いたサポートベクターレグRESSION(SVR)を採用する。
- 関連するジョブおよびクラスタ属性を抽出するための特徴工学的手法を用い、1/nCoresが顕著に予測力の高い特徴量であることが特定された。
- ドメイン固有のMapReduceモデルと機械学習を組み合わせることで特徴選択を支援するグレイボックス手法を採用する。
- HadoopおよびTezワークロードの実際の実行データを用いて、SVRと線形回帰を比較する。
- バイアスとバイアスのバランスを最適化するために、交差検証を用いてSVRのハイパーパrameterを最適化する。
- 複数のクエリワークロード(例:Q2、Q3、Q4)を、20コアの異なるクラスターサイズで検証する。
実験結果
リサーチクエスチョン
- RQ1SVRは、Big Dataワークロードにおいて線形回帰よりもより正確な実行時間予測を提供できるか?
- RQ2多項式カーネルとガウス型カーネルの両方のSVRカーネルタイプは、ジョブ完了時間の予測においてどのように比較されるか?
- RQ3HadoopおよびTezシステムにおいて、実行時間の予測に最も寄与するジョブおよびクラスタ特徴量は何か?
- RQ4コア数の逆数(1/nCores)は、パフォーマンスモデリングのための優れた特徴量として機能するか?
- RQ5履歴データに基づく機械学習モデルは、クラウドベースのBig Dataシステムにおけるスケーラブルでコスト効率の良い容量計画を可能にするか?
主な発見
- SVRは、すべてのテストワークロード(Q2、Q3、Q4)において、線形回帰を一貫して上回り、平均相対誤差が低かった。
- ガウス型および多項式SVRカーネルは、それぞれQ2で4.01%、Q3で22.14%、Q4で42.43%の平均誤差を低下させた。
- 線形回帰は、特に分散が大きくノイズが多い状況では収束しなかった。
- 1/nCores特徴量が最も優れた予測性能を示し、すべての非線形SVRバリアントを上回った。
- 最も性能の優れたモデルは、Q2で3.10%の相対誤差を達成し、クラスターサイズ予測において高い精度を示した。
- SVRを用いたAROMAのようなシステムは、平均12%程度の誤差で完了時刻を推定でき、SLA準拠を支援する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。