Skip to main content
QUICK REVIEW

[論文レビュー] Floe: A Continuous Dataflow Framework for Dynamic Cloud Applications

Yogesh Simmhan, Alok Gautam Kumbhare|arXiv (Cornell University)|Jun 23, 2014
Cloud Computing and Resource Management参考文献 19被引用数 6
ひとこと要約

Floeは、変動するデータレートと遅延要件に応じて実行時におけるデータフロー論理とリソース割り当てを動的に適応可能な、動的クラウドアプリケーション向けの連続的データフロー枠組みである。MapReduce や BSP といった高度なパターンをサポートし、混合リソース割り当て戦略を用いて、多様なワークロード下でも遅延違反を最小限に抑えながらリソースを節約する。

ABSTRACT

Applications in cyber-physical systems are increasingly coupled with online instruments to perform long running, continuous data processing. Such "always on" dataflow applications are dynamic, where they need to change the applications logic and performance at runtime, in response to external operational needs. Floe is a continuous dataflow framework that is designed to be adaptive for dynamic applications on Cloud infrastructure. It offers advanced dataflow patterns like BSP and MapReduce for flexible and holistic composition of streams and files, and supports dynamic recomposition at runtime with minimal impact on the execution. Adaptive resource allocation strategies allow our framework to effectively use elastic Cloud resources to meet varying data rates. We illustrate the design patterns of Floe by running an integration pipeline and a tweet clustering application from the Smart Power Grids domain on a private Eucalyptus Cloud. The responsiveness of our resource adaptation is validated through simulations for periodic, bursty and random workloads.

研究の動機と目的

  • 既存のデータフロー枠組みには実行時における動的適応のサポートが不足しているという問題に対処する。具体的には、アプリケーション論理や構成を再構成・再起動する必要がある。
  • MapReduce や BSP、ストリーム処理といった多様なデータフローパターンを、1つの拡張可能な枠組み内で包括的に組み合わせることを可能にする。
  • 変動するデータレートとパフォーマンス目標に応じて、動的に調整されるクラウド環境における適応的リソース割り当てをサポートする。
  • 長期間にわたる継続的データフロー応用において、実行時更新時の低遅延実行とデータ損失の最小化を維持する。
  • スマートグリッド分野の実世界ユースケースを用いて、周期的、バースト型、ランダムなワークロード下でのフレームワークの応答性と効率性を評価する。

提案手法

  • Floeは、論理をカプセル化できる第一級の処理ユニット「ペレット」を備えたモジュラー・アーキテクチャを採用しており、実行時においてもペレット論理を即座に更新可能である。
  • ストリーム処理、MapReduce、バルク同期並列(BSP)を含む、複数のデータフロー抽象化をサポートし、データフローの柔軟な組み合わせを可能にする。
  • 静的ラックアラウンド、動的、ハイブリッドの3つのリソース割り当て戦略を採用しており、データの特性を推定し、それに応じてリソース使用を調整する。
  • 実行時における動的適応は、データフローを停止せずにペレット論理をインプレースで更新することで実現され、リアルタイムストリームの継続的処理が保証される。
  • データ並列処理とロードバランシングパターン(例:データベース選択、ラウンドロビン)を用いて、クラウドリソース全体にワークロードを効率的に分散する。
  • 性能は、Eucalyptusクラウド上で実行時応用(スマートグリッド分野の統合パイプラインとツイートクラスタリングシステム)を用いたシミュレーションにより検証された。

実験結果

リサーチクエスチョン

  • RQ1長期間にわたる継続的ストリーム処理パイプラインにおいて、実行を停止せずにアプリケーション論理の動的更新をどのように実現できるか?
  • RQ2周期的、バースト型、ランダムなデータレート下で、遅延を最小限に抑えるために最も効果的なリソース割り当て戦略は何か?
  • RQ3MapReduce や BSP といった高度なデータフローパターンを、パフォーマンスとスケーラビリティを損なわず、1つのフレームワーク内でネイティブに組み合わせることは可能か?
  • RQ4ハイブリッドリソース割り当て戦略は、クラウドベースのデータフローにおいて、遅延準拠とリソース効率性の両立をどの程度達成できるか?
  • RQ5統合されたフレームワークは、ストリーム、ファイル、コレクションといった多様なデータ型と、ストリーミング、バッチ、反復処理といった多様な処理モデルを、1つの拡張可能なアーキテクチャ内で効果的に統合できるか?

主な発見

  • ハイブリッドリソース割り当て戦略が、遅延準拠とリソース効率性の両面で最良のバランスを達成し、最適解と比較して性能比が 0.98 を記録した。
  • 静的ラックアラウンド戦略は、動的およびハイブリッド戦略とほぼ同じリソースを消費したが、著しく劣った性能を示し、適応性の低さが顕在化した。
  • フレームワークは、データ損失を伴わず、ペレット論理のインプレース更新を成功裏に実現し、継続的データフローにおける真の実行時動的適応を実現した。
  • シミュレーションの結果、ハイブリッド戦略が、周期的、バースト型、ランダムなすべてのテストワークロードにおいて、遅延違反を効果的に制限しながらリソースを節約した。
  • フレームワークは、統合パイプライン、MapReduceベースの予測、グラフ解析を含む、複雑なマルチパターンデータフローを1つの実行環境で効果的にサポートした。
  • Floeのアーキテクチャは、ストリーム処理、MapReduce、BSP といった多様なデータフロー抽象化のシームレスな組み合わせを可能にし、複数のフレームワークや複雑な調整を必要としない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。