Skip to main content
QUICK REVIEW

[論文レビュー] Towards Reliable (and Efficient) Job Executions in a Practical Geo-distributed Data Analytics System

Xiaoda Zhang, Zhuzhong Qian|arXiv (Cornell University)|Feb 1, 2018
Cloud Computing and Resource Management参考文献 24被引用数 6
ひとこと要約

本稿では、広域ネットワークを横断する効率的で信頼性が高く、障害に強いジョブ実行を可能にする、分散型の地理的に分散したデータ分析システムHoutuを提案する。Houtuは、各主権的データセンターにジョブマネージャーを維持することで、事前のジョブ知識がなく、協働的で作業を奪う方式とフィードバック駆動のリソース適応を用いることで、中央集権的システムと同等のパフォーマンスを達成するとともに、不安定なネットワーク状態や信頼性の低い(スポート)クラウドインスタンス下でもジョブの信頼性を保証する。

ABSTRACT

Geo-distributed data analytics are increasingly common to derive useful information in large organisations. Naive extension of existing cluster-scale data analytics systems to the scale of geo-distributed data centers faces unique challenges including WAN bandwidth limits, regulatory constraints, changeable/unreliable runtime environment, and monetary costs. Our goal in this work is to develop a practical geo-distribued data analytics system that (1) employs an intelligent mechanism for jobs to efficiently utilize (adjust to) the resources (changeable environment) across data centers; (2) guarantees the reliability of jobs due to the possible failures; and (3) is generic and flexible enough to run a wide range of data analytics jobs without requiring any changes. To this end, we present a new, general geo-distributed data analytics system, HOUTU, that is composed of multiple autonomous systems, each operating in a sovereign data center. HOUTU maintains a job manager (JM) for a geo-distributed job in each data center, so that these replicated JMs could individually and cooperatively manage resources and assign tasks. Our experiments on the prototype of HOUTU running across four Alibaba Cloud regions show that HOUTU provides nearly efficient job performance as in the existing centralized architecture, and guarantees reliable job executions when facing failures.

研究の動機と目的

  • 広域ネットワークの帯域幅の変動、規制上の制約、信頼性の低いクラウドインスタンスといった地理的に分散したデータ分析における課題に対処すること。
  • 動的な、信頼性の低い環境(例:スポートインスタンス)においても、障害が発生してもジョブの信頼性を保証するシステムを設計すること。
  • 既存のデータ分析ジョブの変更やジョブ特性に関する事前知識が不要であるにもかかわらず、高いパフォーマンスと効率を維持すること。
  • 主権的データセンター間のデータローカリティと規制境界を尊重するリソース適応とタスクスケジューリングを可能にすること。

提案手法

  • Houtuは、各データセンターにジョブマネージャー(JM)を設けた分散アーキテクチャを採用しており、これによりローカルおよびリモートリソースの自律的かつ協働的管理が可能となる。
  • タスクの盗難をノード更新イベントに変換する新規なワークスティーリングメカニズムを採用し、データローカリティを保ちつつ、データセンター間のデータ移動を最小限に抑える。
  • リソース割り当ては予測ではなく、過去の利用状況からのフィードバックによって駆動されるため、変化するワークロードやネットワーク状態に動的に適応可能である。
  • 各ジョブマネージャーは、履歴的な利用状況に基づいて独立してリソースの要求、維持、解放を実行し、実行時における変化に迅速に対応する。
  • タスクレベルの回復メカニズムを超えて、ジョブレベルのフェイルセーフを実装することで、信頼性の低いスポートインスタンス上の障害に対してもジョブ実行を保証する。
  • 各データセンター内で既存の単一データセンター向けスケジューリングアルゴリズム(例:適応的フィードバックおよびパラメータ化された遅延スケジューリング)を活用するとともに、協働的なタスク割り当てによりデータセンター間の連携を実現する。

実験結果

リサーチクエスチョン

  • RQ1分散型の地理的に分散したデータ分析システムは、データ主権と規制上の制約を尊重しつつ、中央集権的システムと同等のパフォーマンスを達成できるか?
  • RQ2ジョブ特性や安定したネットワーク状態に関する事前知識がなく、リアルタイムでリソース割り当てとタスクスケジューリングを動的に適応できるか?
  • RQ3信頼性の低いスポートインスタンス環境において、ジョブレベルのフェイルセーフを効果的に実現できるか。コスト効率を損なわず、信頼性を確保できるか?
  • RQ4フィードバック駆動のリソース管理は、動的で多領域のクラウド環境において、システム効率をどの程度向上できるか?

主な発見

  • Houtuは、理論的境界を伴う中央集権的アーキテクチャと同等のマケスパンパフォーマンスを達成しており、現実的な条件下で効率的なスケーリングが可能であることが示された。
  • WAN帯域幅が短時間の間で著しく変動する状況下でも、Houtuはジョブセット全体で平均応答時間が低く抑えられることを確認した。
  • Houtuは、スポートインスタンス上の障害に対してもジョブレベルのフェイルセーフを実装することで、タスクレベル回復に依存するシステムを上回るジョブ実行の信頼性を保証した。
  • アリババクラウドの4地域における実験により、Houtuが現実のネットワーク変動とリソースの不安定性下でも高い効率性と信頼性を維持していることが確認された。
  • ジョブの特徴記述や予測が不要なフィードバックベースのリソース適応メカニズムにより、ワークロード変化への対応性が向上し、動的リソーススケーリングが効果的に実現された。
  • 協働的ワークスティーリングメカニズムにより、データセンター間の負荷が効果的にバランスされ、データローカリティ制約を尊重しながら、データセンター間のデータ転送を最小限に抑えることができた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。