Skip to main content
QUICK REVIEW

[論文レビュー] Supervision of the ATLAS High Level Trigger System

S. Wheeler, J. Flammer|arXiv (Cornell University)|May 28, 2003
Distributed and Parallel Computing Systems被引用数 3
ひとこと要約

本論文では、CERNのLHC実験でプロトタイプテスト中に複雑なHLTワークロードを処理する能力を実証した、ATLAS High Level Trigger (HLT) の監視システムを提示する。このシステムは、230ノードにまたがる1,000以上の分散ソフトウェアプロセスの構成、調整、制御、監視を可能にする。ATLAS Online Softwareツールを活用して構築され、スケーラビリティと信頼性に優れている。

ABSTRACT

The ATLAS High Level Trigger (HLT) system provides software-based event selection after the initial LVL1 hardware trigger. It is composed of two stages, the LVL2 trigger and the Event Filter. The HLT is implemented as software tasks running on large processor farms. An essential part of the HLT is the supervision system, which is responsible for configuring, coordinating, controlling and monitoring the many hundreds of processes running in the HLT. A prototype implementation of the supervision system, using tools from the ATLAS Online Software system is presented. Results from scalability tests are also presented where the supervision system was shown to be capable of controlling over 1000 HLT processes running on 230 nodes.

研究の動機と目的

  • 数百の分散ソフトウェアプロセスを管理する、ATLAS High Level Trigger (HLT) のための堅牢な監視システムを設計・実装すること。
  • データ取得中におけるHLTプロセスの信頼性ある構成、調整、制御、およびリアルタイム監視を確保すること。
  • LHCでの導入前に、現実的なHLTワークロード下での監視システムのスケーラビリティを検証すること。
  • 監視システムを既存のATLAS Online Softwareインfraストラクチャと統合し、シームレスな運用を実現すること。
  • ATLAS実験におけるリアルタイムイベント選別に求められる高スルーレート・低レイテンシ要件を満たすこと。

提案手法

  • ATLAS Online Softwareシステムに既存のツールを活用して監視フレームワークを構築した。
  • 監視システムが大規模プロセッサーファーム上で実行されるHLTプロセスを管理する分散アーキテクチャを実装した。
  • イベント選別の2段階(LVL2トリガーおよびイベントフィルタ)を処理するソフトウェアタスクを採用した。
  • 複数ノードにまたがるプロセス状態の動的構成および監視を可能にするようにシステムを設計した。
  • 230台のコンピューティングノードに分散された最大1,000個のHLTプロセスを用いたスケーラビリティテストを実施した。
  • 標準化された通信プロトコルおよびログ記録メカニズムを採用し、システムの可観測性とフォールトトレランスを確保した。

実験結果

リサーチクエスチョン

  • RQ1集中型監視システムは、リアルタイムで何百もの分散HLTプロセスを効果的に管理できるか?
  • RQ2監視システムがパフォーマンス劣化を示さずに、HLTプロセス管理の最大スケールはどの程度か?
  • RQ3LHCデータ取得に見られるような高負荷状態でも、監視システムは信頼性と構成可能性を維持できるか?
  • RQ4監視システムは、広範なATLAS Online Softwareエコシステムとどの程度統合できるか?
  • RQ5フルLHC運用に向けた監視システムのスケーリングにおける主なパフォーマンスボトルネックは何か?

主な発見

  • スケーラビリティテスト中に、監視システムは230ノードにまたがる1,000以上のHLTプロセスを正常に調整・監視した。
  • プロトタイプは高負荷下でも安定した動作を示し、大規模な展開に向けた準備が整っていることを確認した。
  • ATLAS Online Softwareツールとの統合により、分散HLTタスクの構成と監視がシームレスに実現された。
  • システムは低レイテンシの応答時間を維持した。これはHLTパイプラインにおけるリアルタイムイベントフィルタリングにとって不可欠な要因である。
  • スケーラビリティテストにより、監視フレームワークがATLAS実験の想定ワークロードを処理できることを確認した。
  • この解決策は拡張可能で保守性に優れており、将来的なHLTアーキテクチャのアップグレードをサポートした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。