Skip to main content
QUICK REVIEW

[論文レビュー] Towards Stochastically Optimizing Data Computing Flows

Farshid Farhat, Diman Zad Tootaghaj|arXiv (Cornell University)|Jul 14, 2016
Cloud Computing and Resource Management参考文献 18被引用数 4
ひとこと要約

本稿では、分散システムにおけるデータコンピューティングフローのための確率的最適化フレームワークを提案する。ジョブ実行時間をキューイング理論を用いてモデル化することで、エンドツーエンド応答時間を最小化する。データアクセスポイント(DAP)におけるサービス時間分布を監視し、サーバーの非均一性と確率的挙動に基づいて動的にタスクを割り当てることで、ベースラインヒューリスティクスと比較して平均応答時間を最大54%、分散を最大71%削減する。低オーバーヘッドで最適性能に近い結果を達成する。

ABSTRACT

With rapid growth in the amount of unstructured data produced by memory-intensive applications, large scale data analytics has recently attracted increasing interest. Processing, managing and analyzing this huge amount of data poses several challenges in cloud and data center computing domain. Especially, conventional frameworks for distributed data analytics are based on the assumption of homogeneity and non-stochastic distribution of different data-processing nodes. The paper argues the fundamental limiting factors for scaling big data computation. It is shown that as the number of series and parallel computing servers increase, the tail (mean and variance) of the job execution time increase. We will first propose a model to predict the response time of highly distributed processing tasks and then propose a new practical computational algorithm to optimize the response time.

研究の動機と目的

  • 分散システムにおける性能の確率的変動(遅延タスク)に起因するスケーリング制限を解消すること。
  • Hadoop や MapReduce のような非確率的フレームワークにおける決定論的スケジューリングの限界を克服すること。
  • リアルタイムでのサーバーのサービス時間分布の監視を活用し、実用的で低オーバーヘッドのジョブスケジューリング最適化手法を開発すること。
  • 直列および並列コンponents を併用するデータフローワークフローにおけるエンドツーエンドジョブ実行時間を最小化すること。
  • 解析的キューイングモデルと実用的スケジューリングを統合し、クラウドリソースを確率的キューイングブロックとしてモデル化すること。

提案手法

  • 確率的サービス時間分布を持つ直列・並列コンピューティングコンponents(SDCC/PDCC)として分散データフローをモデル化する。
  • 各データアクセスポイント(DAP)における応答時間分布(例:指数分布、パレート分布)を監視・追跡し、サーバーの非均一性を捉える。
  • 均衡に基づくタスクレート割り当てを用いる:λ₁RT_DCC₁ = λ₂RT_DCC₂ = ... = λₙRT_DCCₙ により、DCC間での負荷をバランスさせる。
  • 階層的スケジューリングアルゴリズム(アルゴリズム3)を実装し、DCCの種別(SDCC または PDCC)およびサーバーの性能に応じてタスクを割り当てる。
  • DCC_allocate および PDCC_allocate のサブルーチンを適用し、サーバーのサービスレートおよび現在のキューイング挙動に基づいてワークロードをサーバーに割り当てる。
  • 均一性の仮定を避けるデータドリブンな動的アプローチを採用し、システム性能のリアルタイムな確率的変動をモデル化する。

実験結果

リサーチクエスチョン

  • RQ1直列または並列処理コンponents の数を増加させると、分散システムにおけるエンドツーエンドジョブ実行時間の平均および分散にどのように影響するか?
  • RQ2サーバーのサービス時間の確率的モデル化は、決定論的かつ均一な仮定に比べてジョブスケジューリングのパフォーマンスを向上させ得るか?
  • RQ3非均一で確率的なデータフローワークロードにおいて、エンドツーエンド応答時間を最小化する最適なタスク割り当て戦略は何か?
  • RQ4実用的で低オーバーヘッドのスケジューリングアルゴリズムは、平均および分散の低減において最適解にどの程度近づけるか?
  • RQ5DAPのサービス時間分布の監視は、大規模データパイプラインにおけるより良い負荷分散および遅延タスクの緩和にどの程度寄与できるか?

主な発見

  • 提案手法は、複数のシナリオにわたり、ヒューリスティクスベースラインアルゴリズムと比較して平均応答時間を最大54%削減した。
  • ベースラインと比較して、応答時間の分散を71%削減し、予測可能性が著しく向上した。
  • 遅延指数分布、パレート分布、および混合分布を用いた全テストシナリオにおいて、提案手法は平均および分散の両面でベースラインを上回った。
  • 全探索により計算された最適解との差が小さい範囲で性能を達成したため、強い実用的有効性が示された。
  • 確率的サーバー挙動のモデル化により、大規模データフローにおける遅延タスクや長尾応答時間の影響を効果的に軽減した。
  • 機械学習ベースの代替手法と比較してオーバーヘッドが低く、大規模クラウドおよびデータセンターデプロイメントに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。