Skip to main content
QUICK REVIEW

[論文レビュー] Towards automation of computing fabrics using tools from the fabric management workpackage of the EU DataGrid project

O. Bärring|ArXiv.org|May 28, 2003
Distributed and Parallel Computing Systems参考文献 2被引用数 5
ひとこと要約

本論文では、EU DataGridプロジェクトのファブリック管理ワーキングパッケージ内で開発されたツールを用いて、大規模コンピューティングファブリックの管理を自動化するフレームワークを提示する。中央集権的な設定管理、パフォーマンス/例外監視、ノードインストール、サービス設定を、標準のLinuxツール(例:rpm、kickstart)を用いて統合することで、2003年Q3までに企業規模のコンピューティングファームにおけるスケーラブルかつ自動化された管理を実現する。

ABSTRACT

The EU DataGrid project workpackage 4 has as an objective to provide the necessary tools for automating the management of medium size to very large computing fabrics. At the end of the second project year subsystems for centralized configuration management (presented at LISA'02) and performance/exception monitoring have been delivered. This will soon be augmented with a subsystem for node installation and service configuration, which is based on existing widely used standards where available (e.g. rpm, kickstart, init.d scripts) and clean interfaces to OS dependent components (e.g. base installation and service management). The three subsystems together allow for centralized management of very large computer farms. Finally, a fault tolerance system is being developed for tying together the above subsystems to form a complete framework for automated enterprise computing management by 3Q03. All software developed is open source covered by the EU DataGrid project license agreements. This article describes the architecture behind the designed fabric management system and the status of the different developments. It also covers the experience with an existing tool for automated configuration and installation that have been adapted and used from the beginning to manage the EU DataGrid testbed, which is now used for LHC data challenges.

研究の動機と目的

  • ハイパフォーマンスコンピューティング環境における中規模から大規模なコンピューティングファブリックの管理の課題に対処すること。
  • 企業規模のコンピュータファーム向けに中央集権的で自動化された管理フレームワークを開発すること。
  • 広く採用されているLinuxスタンダード(例:rpm、kickstart)を統合的にファブリック管理システムに組み込むこと。
  • 監視、設定、インストールサブシステムの統合を通じて、障害耐性とシステム信頼性を向上させること。
  • 広範な展開と拡張性を促進するため、EU DataGridプロジェクトのライセンス条項に基づきオープンソースとして提供するツールを提供すること。

提案手法

  • システムインストールおよびサービス設定に、既存のオープンスタンダード(rpm、kickstart、init.dスクリプトなど)を活用する。
  • 移植性と保守性を高めるために、OS依存コンponentへの明確で抽象化されたインターフェースを設計する。
  • 中央集権的設定管理、パフォーマンス/例外監視、ノードインストール/サービス設定の3つのコアサブシステムを統合する。
  • 3つのサブシステムを統合・調整するためのフェイルセーフシステムを構築し、完全な自動化フレームワークを構築する。
  • 段階的展開と拡張性を可能にするために、モジュラーでコンポーネント指向のアーキテクチャを採用する。
  • 透明性とコミュニティの採用を促進するため、オープンソースソフトウェアをEU DataGridプロジェクトのライセンス条項に基づき採用する。

実験結果

リサーチクエスチョン

  • RQ1標準化されたツールを用いて、どのように大規模コンピューティングファブリックを効率的かつ自動的に管理できるか?
  • RQ2設定、監視、インストールサブシステムを統合的に管理フレームワークに統合するためのアーキテクチャパターンは何か?
  • RQ3広く使われているLinuxスタンダード(例:rpm、kickstart)を、自動化されたファブリック管理にどの程度活用できるか?
  • RQ4サブシステム間の連携を通じて、分散型ファブリック管理システムで障害耐性をどのように達成できるか?
  • RQ5実際の高エネルギー物理学コンピューティングテストベッドにこのようなシステムを展開する際の実務的課題と利点は何か?

主な発見

  • ファブリック管理システムは、設定管理、パフォーマンス監視、ノードインストールを1つの中央集権的フレームワークに統合することに成功した。
  • 本システムは、LHCデータチャレンジを支援するEU DataGridテストベッドの管理にすでに使用されており、実世界での適用可能性が裏付けられた。
  • rpmやkickstartなどの標準Linuxツールの使用により、相互運用性が確保され、開発の負荷が低減された。
  • モジュラー設計のおかげで段階的展開が可能であり、2年目までに設定管理および監視サブシステムがすでに提供された。
  • サブシステムを統合するフェイルセーフシステムは開発中であり、2003年Q3までに完全な自動化を実現する予定である。
  • すべてのソフトウェアコンポーネントが、EU DataGridプロジェクトのライセンス条項に基づきオープンソースとしてリリースされ、透明性と再利用性が促進された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。