Skip to main content
QUICK REVIEW

[論文レビュー] AliEn Resource Brokers

Pablo Sáiz, P. Bunc̆ić|ArXiv.org|Jun 13, 2003
Distributed and Parallel Computing Systems参考文献 1被引用数 19
ひとこと要約

本論文では、ALICE実験向けの軽量なGRIDフレームワークとしてAliEnリソースブローカーを提示する。このフレームワークは、ジョブおよびファイル転送ブローカーに簡素化されたプルベースアーキテクチャを採用し、ペタバイト規模のデータを管理する。分散データセットへの透過的で場所に依存しないアクセスを可能にするとともに、1年間に10⁹ファイルの信頼性の高い追跡を、分散ファイルカタログと効率的なリソースブローキングにより実現する。

ABSTRACT

AliEn (ALICE Environment) is a lightweight GRID framework developed by the Alice Collaboration. When the experiment starts running, it will collect data at a rate of approximately 2 PB per year, producing O(109) files per year. All these files, including all simulated events generated during the preparation phase of the experiment, must be accounted and reliably tracked in the GRID environment. The backbone of AliEn is a distributed file catalogue, which associates universal logical file name to physical file names for each dataset and provides transparent access to datasets independently of physical location. The file replication and transport is carried out under the control of the File Transport Broker. In addition, the file catalogue maintains information about every job running in the system. The jobs are distributed by the Job Resource Broker that is implemented using a simplified pull (as opposed to traditional push) architecture. This paper describes the Job and File Transport Resource Brokers and shows that a similar architecture can be applied to solve both problems.

研究の動機と目的

  • ALICE実験から生じる膨大なデータ量(年間約2 PB、10⁹ファイル)を、分散GRID環境で効果的に管理する課題に対処する。
  • 物理的な場所に関係なく、分散ストレージノード間でデータセットへの透過的アクセスと信頼性の高い追跡を保証する。
  • 大規模科学実験が要請する高いデータレートとジョブスルーブットを処理できる、スケーラブルで軽量なフレームワークを設計する。
  • ジョブとファイル転送の両方を統一されたリソースブローキングモデルで実装し、簡素化されたプルベースアーキテクチャを用いて複雑さを低減するとともに信頼性を向上させる。

提案手法

  • ユニバーサルな論理ファイル名を物理的ファイル位置にマッピングする分散ファイルカタログを採用し、GRID全体で透過的なアクセスを可能にする。
  • 中央集権的制御下でファイルのレプリケーションおよび移動を管理するファイル転送ブローカーを用い、データの可用性と整合性を確保する。
  • ワーカーがジョブをリクエストするプルベースアーキテクチャを採用したジョブリソースブローカーを実装し、調整のオーバーヘッドを低減する。
  • ジョブ追跡をファイルカタログに統合し、すべての実行中のジョブに関するメタデータをファイル情報とともに保持できるようにする。
  • ジョブスケジューリングとファイル転送の両方で、同じアーキテクチャ的パターン(プルベースのジョブおよびファイル配布)を再利用することで、一貫性を確保し、システム設計を単純化する。
  • 水平スケーリングを可能に設計し、ALICE実験で想定される高ボリュームのデータおよびジョブワークロードを処理できるようにする。

実験結果

リサーチクエスチョン

  • RQ1分散GRID環境において、高スルーレット科学的データワークロードに適したスケーラブルかつ信頼性の高いリソースブローカリングシステムをどのように設計できるか?
  • RQ2ALICEのような大規模実験において、効率的かつフェイルセーフなジョブおよびファイル配布を実現するアーキテクチャ的パターンは何か?
  • RQ3統一されたプルベースモデルが、ハイパフォーマンスコンピューティングフレームワークにおいて、ジョブスケジューリングとファイル転送の両方を効果的に管理できるか?
  • RQ4データ整合性と追跡を維持しながら、ペタバイト規模のデータセットに対して場所に依存しないアクセスをどのように実現できるか?
  • RQ5分散で非中央集権的なシステムにおいて、10⁹件のファイルおよび数千件の並行ジョブの信頼性の高い追跡を保証するメカニズムは何か?

主な発見

  • ジョブおよびファイル転送リソースブローカーのプルベースアーキテクチャは、従来のプッシュモデルと比較して、調整のオーバーヘッドを顕著に低減し、システムのスケーラビリティを向上させる。
  • 分散ファイルカタログは、物理的場所に関係なくデータセットへの透過的アクセスを成功裏に実現し、GRID全体でシームレスなデータアクセスを可能にする。
  • システムはすべてのジョブおよびファイルの信頼性の高い追跡を可能にし、カタログにメタデータを格納することで、完全な監査可能性とプロバンセンス追跡が実現される。
  • フレームワークは、ALICE実験が要請する年間2 PBのデータ負荷および10⁹件のファイルを処理できる能力を有している。
  • ジョブとファイルブローキングの両方で共通のアーキテクチャ的パターンを再利用することで、システム設計の単純化、保守性の向上、およびフェイルセーフ性の向上が達成される。
  • テスト段階において、実装はスケーリングに伴う安定性とパフォーマンスを示し、高エネルギー物理学分野における生産環境での適用適性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。