Skip to main content
QUICK REVIEW

[论文解读] Supervision of the ATLAS High Level Trigger System

S. Wheeler, J. Flammer|arXiv (Cornell University)|May 28, 2003
Distributed and Parallel Computing Systems被引用 3
一句话总结

本文提出了一种用于ATLAS高级触发器(HLT)的监督系统,实现了对230个节点上超过1,000个分布式软件进程的配置、协调、控制和监控。该系统基于ATLAS在线软件工具构建,在CERN的LHC实验原型测试中,成功展示了其在处理复杂HLT工作负载时的可扩展性和可靠性。

ABSTRACT

The ATLAS High Level Trigger (HLT) system provides software-based event selection after the initial LVL1 hardware trigger. It is composed of two stages, the LVL2 trigger and the Event Filter. The HLT is implemented as software tasks running on large processor farms. An essential part of the HLT is the supervision system, which is responsible for configuring, coordinating, controlling and monitoring the many hundreds of processes running in the HLT. A prototype implementation of the supervision system, using tools from the ATLAS Online Software system is presented. Results from scalability tests are also presented where the supervision system was shown to be capable of controlling over 1000 HLT processes running on 230 nodes.

研究动机与目标

  • 设计并实现一个稳健的ATLAS高级触发器(HLT)监督系统,以管理数百个分布式软件进程。
  • 确保在数据获取期间对HLT进程进行可靠配置、协调、控制和实时监控。
  • 在LHC部署前,通过真实HLT工作负载验证监督系统的可扩展性。
  • 将监督系统与现有的ATLAS在线软件基础设施集成,实现无缝运行。
  • 支持ATLAS实验中实时事件选择所需的高吞吐量和低延迟要求。

提出的方法

  • 利用ATLAS在线软件系统中现有的工具构建监督框架。
  • 采用分布式架构,监督系统管理运行在大型处理器集群上的HLT进程。
  • 使用软件任务分两个阶段处理事件选择:LVL2触发和事件过滤。
  • 设计系统以动态配置和监控跨多个节点的进程状态。
  • 在230台计算节点上,对最多1,000个HLT进程进行了可扩展性测试。
  • 采用标准化通信协议和日志机制,确保系统可观测性和故障容错能力。

实验结果

研究问题

  • RQ1如何通过集中式监督系统实现实时管理数百个分布式HLT进程?
  • RQ2监督系统在不出现性能下降的情况下,最多可支持多大规模的HLT进程管理?
  • RQ3在典型LHC数据采集的高负载条件下,监督系统能否保持可靠性和可配置性?
  • RQ4该系统与更广泛的ATLAS在线软件生态系统集成的效果如何?
  • RQ5在为全LHC运行扩展监督系统时,关键性能瓶颈是什么?

主要发现

  • 在可扩展性测试期间,监督系统成功协调并监控了230个节点上超过1,000个HLT进程。
  • 原型在高负载下表现出稳定运行,证实了系统已具备大规模部署的准备就绪状态。
  • 与ATLAS在线软件工具的集成实现了对分布式HLT任务的无缝配置和监控。
  • 系统保持了低延迟响应时间,这对HLT流水线中的实时事件过滤至关重要。
  • 可扩展性测试证实,监督框架能够处理ATLAS实验预期的工作负载。
  • 该解决方案证明具有良好的可扩展性和可维护性,支持HLT架构的未来升级。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。