Skip to main content
QUICK REVIEW

[論文レビュー] Monitoring Extreme-scale Lustre Toolkit

Michael J. Brim, Joshua K. Lothian|arXiv (Cornell University)|Apr 26, 2015
Scientific Computing and Data Management参考文献 1被引用数 4
ひとこと要約

モニタリング極大規模Lustreツールキット(MELT)は、クライアントおよびサーバーノードをまたいでクロスドメイン監視を可能にする分散オーバーレイネットワークを活用し、大規模Lustreファイルシステムにおける統合的で低オーバーヘッドのパフォーマンス監視および分析フレームワークです。リアルタイムの健全性とパフォーマンス要約、複数レベルの診断に適したインタラクティブなCLIツール、および一般的なパフォーマンス問題の根本原因分析のための将来の自動化を提供します。

ABSTRACT

We discuss the design and ongoing development of the Monitoring Extreme-scale Lustre Toolkit (MELT), a unified Lustre performance monitoring and analysis infrastructure that provides continuous, low-overhead summary information on the health and performance of Lustre, as well as on-demand, in- depth problem diagnosis and root-cause analysis. The MELT infrastructure leverages a distributed overlay network to enable monitoring of center-wide Lustre filesystems where clients are located across many network domains. We preview interactive command-line utilities that help administrators and users to observe Lustre performance at various levels of resolution, from individual servers or clients to whole filesystems, including job-level reporting. Finally, we discuss our future plans for automating the root-cause analysis of common Lustre performance problems.

研究の動機と目的

  • 極大規模HPC環境で使用される大規模でマルチドメインのLustreファイルシステムにおけるパフォーマンス問題の監視と診断の課題に対処すること。
  • ファイルシステム全体、サーバー、クライアントをカバーする継続的かつ低オーバーヘッドのパフォーマンス監視を提供する統合インfraストラクチャを設計すること。
  • 個々のコンponentからジョブレベルのパフォーマンスまで、さまざまな粒度でインタラクティブかつオンデマンドの診断を可能にすること。
  • 繰り返し発生するLustreのパフォーマンス問題の自動根本原因分析の基盤を築くこと。

提案手法

  • MELTフレームワークは、複数のネットワークドメインにまたがるパフォーマンスメトリクスの収集と相関に、分散オーバーレイネットワークを活用し、地理的または管理的に分離されたHPCセンターにおける可視性を確保します。
  • 既存のLustre監視ツールと統合することで、最小限のランタイムオーバーヘッドでパフォーマンスデータを集約・要約します。
  • 管理者およびユーザーが、個々のクライアントからフルファイルシステムまで、さまざまな抽象化レベルでのパフォーマンス照会が可能なインタラクティブなコマンドラインユーティリティを提供します。
  • ジョブ実行メタデータとパフォーマンスデータを関連付けることで、ジョブレベルのレポートをサポートします。
  • データ収集と分析を分離し、分散データ処理を可能にする設計により、極大規模の展開にもスケーラブルです。
  • 将来の拡張では、一般的な障害パターンを特定し、是正策を提案する自動診断パイプラインを統合する予定です。

実験結果

リサーチクエスチョン

  • RQ1極大規模HPC環境における大規模でマルチドメインのLustreファイルシステムにおいて、パフォーマンス監視をどのように効果的にスケーリングできるか?
  • RQ2LustreコンポONENTのパフォーマンスを劣化させることなく、継続的かつ低オーバーヘッドで監視するためのアーキテクチャパターンは何か?
  • RQ3システム管理者およびエンドユーザーの両方に対して、統合的で多様な粒度の診断をどのように提供できるか?
  • RQ4Lustreにおける一般的なパフォーマンスボトルネックの根本原因分析を効果的に行うためのメカニズムは何か?
  • RQ5自動診断をLustreの本番監視スタックにどのように統合できるか?

主な発見

  • MELTは、分散オーバーレイネットワークを活用することで、複数のネットワークドメインにまたがるセンター規模のLustreファイルシステムに対する継続的かつ低オーバーヘッドの監視を実現しました。
  • ツールキットは、個々のクライアントからフルファイルシステムまで、細粒度のレベルでリアルタイムのパフォーマンス観測が可能なインタラクティブなCLIユーティリティを提供しています。
  • ジョブレベルのパフォーマンスレポートがサポートされており、I/O動作とアプリケーション実行を関連付けることができます。
  • 今後のリリースで、一般的なパフォーマンス問題の自動根本原因分析の統合が実現可能であることが実証されました。
  • スケーラビリティと拡張性を達成した設計であり、極大規模HPC環境への展開に適しています。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。