Skip to main content
QUICK REVIEW

[论文解读] Report of the Snowmass 2013 Computing Frontier Working Group on Distributed Computing and Facility Infrastructures

K. Bloom, R. Gerber|arXiv (Cornell University)|Nov 9, 2013
Distributed and Parallel Computing Systems参考文献 1被引用 3
一句话总结

本报告评估了高能物理(HEP)领域分布式计算与设施基础设施的现状及未来,强调全球大型强子对撞机计算网格(WLCG)在通过分层、全球分布的高吞吐量计算(HTC)模式支持大型强子对撞机(LHC)实验中的关键作用。报告主张持续投资WLCG,整合高性能计算(HPC)与HTC资源,并使软件适应多核与GPU架构,以应对来自能量前沿、强度前沿和宇宙学前沿日益增长的数据与模拟需求。

ABSTRACT

This is the report of the Snowmass 2013 Computing Frontier Working Group on Distributed Computing and Facility Infrastructures.

研究动机与目标

  • 评估至2017年美国高能物理(HEP)社区当前及预期的计算基础设施需求。
  • 评估全球大型强子对撞机计算网格(WLCG)作为LHC实验主要分布式计算基础设施的作用。
  • 考察国家计算中心中HPC与HTC范式的整合及其对未来HEP研究的相关性。
  • 识别在提升LHC亮度、事件复杂度和数据速率背景下扩展计算资源所面临的挑战。
  • 推荐软件演进、资源多样化及持续资金投入策略,以维持HEP的计算准备状态。

提出的方法

  • 分析现有的HEP计算工作负载,区分HTC(高度并行)与HPC(紧密耦合、高性能)计算模型。
  • 评估WLCG的分层架构——CERN的Tier-0、用于数据重新处理与归档的Tier-1站点,以及用于物理分析与模拟的Tier-2站点。
  • 回顾国家计算中心(如NERSC)在支持HTC与HPC工作负载方面的作用,包括软件与中间件开发。
  • 评估LHC数据速率(从300 Hz增至1 kHz)和堆叠效应(每事件20至25个相互作用)对基础设施可扩展性的影响。
  • 提出对WLCG的渐进式升级方案,并整合机会性资源,包括商业云和国家级HPC中心。
  • 建议对软件进行现代化改造,以支持多核与GPU并行计算,充分发挥新兴硬件的能力。

实验结果

研究问题

  • RQ1WLCG基础设施应如何演进,以应对至2017年及以后预期的LHC数据速率提升与事件复杂度增加?
  • RQ2国家级HPC中心在多大程度上可支持传统上由HTC系统处理的HEP工作负载?实现这一目标需要哪些调整?
  • RQ3在能量前沿、强度前沿与宇宙学前沿的未来HEP实验中,扩展分布式计算基础设施面临哪些关键技术与操作挑战?
  • RQ4如何使HEP软件有效利用大规模多核与GPU加速架构?
  • RQ5协调的资源共享与培训在使强度前沿实验能够访问现有计算设施方面应发挥何种作用?

主要发现

  • WLCG拥有2 MHS06的CPU算力与190 PB的磁盘存储,2012年成功持续支持30万个核心,为LHC数据处理与分析提供26亿CPU小时的计算能力。
  • WLCG的分层、全球分布的HTC模式仍非常适合LHC的 embarrassingly parallel(高度并行)工作负载,预计将继续作为LHC实验的主要计算资源。
  • 预计至2017年,HEP对HPC资源的需求将超出供应四倍,凸显国家级HPC中心存在严重短缺。
  • NERSC等国家级中心在支持HTC与HPC工作负载方面能力日益增强,但HEP实验必须主动与这些中心对接以获取资源。
  • 软件必须演进以利用细粒度(如GPU)与粗粒度(如MPI)并行性,以充分释放多核与加速架构的潜力。
  • 机会性地使用商业云、大学集群及国家级HPC中心,对于多样化计算架构、确保在数据需求持续增长背景下的长期可持续性至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。