Skip to main content
QUICK REVIEW

[论文解读] Atlas Data-Challenge 1 on NorduGrid

P. Eerola, B. Kónya|arXiv (Cornell University)|Jun 2, 2003
Distributed and Parallel Computing Systems参考文献 2被引用 8
一句话总结

本文介绍了 NorduGrid 在 ATLAS 数据挑战 1 中的成功贡献,这是首次在网格上进行的大规模 LHC 计算实验,期间北欧物理学家处理了超过 2 TB 的输入数据,并通过 4,750 多个网格作业生成了 2.5 TB 的输出。借助轻量级、可移植的中间件,NorduGrid 实现了动态作业调度、自动化数据分发,并无缝集成到异构集群的存储和副本目录中。

ABSTRACT

The first LHC application ever to be executed in a computational Grid environment is the so-called ATLAS Data-Challenge 1, more specifically, the part assigned to the Scandinavian members of the ATLAS Collaboration. Taking advantage of the NorduGrid testbed and tools, physicists from Denmark, Norway and Sweden were able to participate in the overall exercise starting in July 2002 and continuing through the rest of 2002 and the first part of 2003 using solely the NorduGrid environment. This allowed to distribute input data over a wide area, and rely on the NorduGrid resource discovery mechanism to find an optimal cluster for job submission. During the whole Data-Challenge 1, more than 2 TB of input data was processed and more than 2.5 TB of output data was produced by more than 4750 Grid jobs.

研究动机与目标

  • 在真实的 LHC 数据处理工作负载下,验证 ATLAS 计算模型和软件套件。
  • 测试网格中间件在生产规模、分布式计算环境中的集成能力。
  • 展示轻量级、可移植中间件(NorduGrid)在北欧异构计算中心处理高能物理工作负载的可行性。
  • 评估在大规模、长时间运行的工作负载下,数据分发、作业调度和资源发现机制的鲁棒性。
  • 通过使北欧机构能够参与 LHC 的首次重大计算挑战,支持全球 ATLAS 合作。

提出的方法

  • 在北欧和芬兰的超级计算中心的 1,000 个 CPU 上,通过最小系统修改,部署了轻量级、可移植的网格中间件(NorduGrid)。
  • 使用 xRSL 语言指定作业需求,包括可执行文件、参数、输入文件和运行时环境依赖。
  • 实现了基于 NorduGrid 信息系统的动态作业调度系统,结合副本目录,定位具备所需输入数据的最优集群。
  • 通过网格管理器自动化数据处理,该管理器在需要时从存储单元或副本目录预先下载输入文件并在本地缓存。
  • 通过站点管理员脚本实现运行时环境配置,在作业执行前设置软件包(例如,ATLAS rpm)的环境。
  • 使用 ngcopy 将大型输入文件直接从外部源(俄罗斯、美国)传输到 NorduGrid 存储单元,用于第三阶段重建。

实验结果

研究问题

  • RQ1轻量级、可移植的网格中间件能否在分布式、异构环境中有效支持复杂、数据密集型物理工作负载的执行?
  • RQ2在资源动态可用的广域网格中,作业调度和数据分发的自动化效率如何?
  • RQ3在跨多个模拟和重建阶段处理多 TB 数据集时,网格基础设施的可扩展性和可靠性极限是什么?
  • RQ4在安全隔离的计算环境中,如何处理外部数据依赖(例如,噪声数据库)?
  • RQ5现有非网格计算中心在无需重大基础设施改造的情况下,能在多大程度上被集成到生产级网格中?

主要发现

  • 在挑战期间,NorduGrid 成功处理了超过 2 TB 的输入数据,并生成了超过 2.5 TB 的输出数据,涉及 4,750 多个网格作业。
  • 系统实现了高可靠性和可扩展性,1,000 个 CPU 持续全天候运行,集群间实现了动态负载均衡。
  • 通过使用副本目录和自动化数据检索,即使输入文件不在本地,也能实现高效的作业放置。
  • 运行时环境机制确保了在不同集群间的一致软件配置,支持复杂的 ATLAS 软件堆栈。
  • 系统通过本地缓存机制处理了外部数据依赖(例如,LArCalorimeter 噪声数据库),解决了在隔离环境中的连接问题。
  • NorduGrid 的中间件在压力下表现出稳定和灵活,因此被北欧多个计算中心采纳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。