[论文解读] Building a Shared Resource HPC Center Across University Schools and Institutes: A Case Study
本文报告了乔治·华盛顿大学建立共享高性能计算中心(HPCC)的案例研究,将分散的HPC资源整合为集中化、专业管理的计算集群。通过实施基于公平共享的资源分配模型,并允许选择性优先投资,该校在多个研究领域实现了成本效益提升、资源利用率提高以及用户支持增强,最终建成一个可扩展、可持续的HPC基础设施,服务超过430名研究人员。
Over the past several years, The George Washington University has recruited a significant number of researchers in a wide variety of domains requiring the availability of advanced computational resources. We discuss the challenges and obstacles encountered planning and establishing a first-time high performance computing center at the university level and present a set of solutions that will be useful for any university developing a fledgling high performance computing center. We focus on justification and cost model, strategies for determining anticipated use cases, planning appropriate resources, staffing, user engagement, and metrics for gauging success.
研究动机与目标
- 应对研究型大学内不同学术领域日益增长的先进计算资源需求。
- 解决由分散、教师拥有的HPC集群所导致的低效与运维负担。
- 建立一个具备可持续资金、人员配置与治理模式的集中式共享HPC中心。
- 制定用户参与、培训与性能追踪策略,以确保系统采纳与实际影响。
- 为其他希望建设或扩展共享HPC设施的高校提供可复用的框架。
提出的方法
- 建立了包含213个节点的集中式HPC集群(Colonial One),涵盖CPU、GPU与高内存配置,采用戴尔(Dell)与专用硬件相结合的方式。
- 实施基于公平共享的调度模型,并允许根据财务投资情况选择性获得优先分配权,避免了复杂的共管(condo)所有权模式。
- 部署三级存储架构:主NFS存储、高速Lustre临时存储,以及通过戴尔Compellent实现的长期归档存储。
- 与XSEDE集成,以获取外部培训与访问支持,并启动内部培训项目,包括工作坊与视频教程。
- 培训并部署熟悉特定研究领域需求的HPC专业人员,以支持用户接入与应用部署。
- 开发数据仓库,用于追踪作业历史、培训参与情况、使用模式及资助成果,以支持绩效评估与针对性支持。
实验结果
研究问题
- RQ1高校如何有效将分散的HPC资源整合为集中管理的共享设施?
- RQ2何种成本分担与投资模式可在确保公平性的同时激励不同学术单位的参与?
- RQ3如何系统性地扩展用户参与与培训,以支持多样化、多学科的用户群体?
- RQ4衡量共享HPC中心成功与影响的最有效指标是什么?
- RQ5何种运营与人员配置模式可确保大学级HPC基础设施的长期可持续性与高性能?
主要发现
- 乔治·华盛顿大学的共享HPCC成功整合了多个学院的HPC资源,服务超过430名研究人员,覆盖110多个研究团队。
- 基于公平共享的模型并辅以可选优先投资机制,实现了资源的公平获取,同时允许高影响力团队扩展其计算能力。
- 该中心日均处理超过2,000个作业,持续稳定运行,展现出高度的可靠性与资源利用率。
- 用户参与举措,包括培训活动与XSEDE合作,显著提升了用户上手效率与应用支持水平。
- 数据仓库支持了针对使用情况、培训效果与科研影响的精准报告,包括用户自报的资助项目与发表成果。
- 从Terascala迁移至Intel Enterprise Edition Lustre显著提升了存储性能与可扩展性,为长期发展提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。