[论文解读] Extreme Scaling of Supercomputing with Stranded Power: Costs and Capabilities
本文提出零碳云(ZCCloud),一种超级计算模型,利用搁浅可再生能源——由于电网阻塞或间歇性导致市场价值为负的电力——以大幅降低资本和运营成本。通过在风能和太阳能发电站附近部署计算硬件,ZCCloud消除了输电和冷却成本,在极端规模系统中,实现高达45%的资本成本降低和在固定预算下80%更高的峰值PFLOPS性能。
Power consumption (supply, heat, cost) and associated carbon emissions (environmental impact) are increasingly critical challenges in scaling supercomputing to Exascale and beyond. We proposes to exploit stranded power, renewable energy that has no value to the power grid, for scaling supercomputers, Zero-Carbon Cloud (ZCCloud), and showing that stranded power can be employed effectively to expand computing [1]. We build on those results with a new analysis of stranded power, characterizing temporal, geographic, and interval properties. We simulate production supercomputing workloads and model datacenter total-cost-of-ownership (TCO), assessing the costs and capabilities of stranded-power based supercomputing. Results show that the ZCCloud approach is cost-effective today in regions with high cost power. The ZCCloud approach reduces TCO by 21-45%, and improves cost-effectiveness up to 34%. We study many scenarios. With higher power price, cheaper computing hardware and higher system power density, benefits rise to 55%, 97% and 116% respectively. Finally, we study future extreme-scale systems, showing that beyond terascale, projected power requirements in excess of 100MW make ZCCloud up to 45% lower cost, for a fixed budget, increase peak PFLOPS achievable by 80%.
研究动机与目标
- 应对超算(Exascale及更高)在电力成本、冷却和碳排放方面日益严峻的挑战。
- 探索利用搁浅电力——具有负市场价值的可再生能源——作为大规模超级计算唯一能源来源的可行性。
- 量化ZCCloud在不同电力价格、硬件成本和系统功耗密度条件下,与传统超级计算中心相比的成本效益和可扩展性。
- 评估ZCCloud在极端规模系统中的潜力,特别是在固定预算约束下降低资本支出并提高计算吞吐量的能力。
提出的方法
- 利用28个月期间7000万笔MISO市场交易数据,表征搁浅电力在时间、地理和时间间隔上的特性。
- 在与可再生能源发电站共址的ZCCloud基础设施上模拟生产级HPC工作负载,以评估生产力和工作负载率(最高达80%)。
- 集成详细的总拥有成本(TCO)模型,涵盖资本支出(CapEx)、折旧(3%资本成本,5–12年寿命)、以及组件级成本(服务器、网络、SSD、电池、机柜、自然冷却)。
- 在不同电力价格、硬件成本和系统功耗密度的多种情景下,将ZCCloud与传统超级计算中心进行对比。
- 针对功耗超过100MW的极端规模系统(超越万亿级)建立模型,评估在固定预算约束下的成本与性能权衡。
- 利用历史MISO搁浅电力数据,原型化一个108核的ZCCloud系统,并规划在风电场部署一个78节点(2500核)系统,以实现真实工作负载的验证。
实验结果
研究问题
- RQ1搁浅电力——具有负市场价值的可再生能源——是否能够以足够的工作负载率和可靠性支持生产级HPC工作负载?
- RQ2在不同电力价格和硬件成本下,ZCCloud与传统超级计算中心相比,在总拥有成本(TCO)和成本效益(每美元计算吞吐量)方面有何差异?
- RQ3在固定预算约束下,ZCCloud在极端规模系统(Exascale及更高)中带来哪些成本和性能优势?
- RQ4硬件商品化趋势和系统功耗密度提升如何影响ZCCloud的相对优势?
- RQ5在保持或提升系统生产力的前提下,ZCCloud在多大程度上可降低资本成本并提高峰值PFLOPS?
主要发现
- 在基线条件下,与传统超级计算中心相比,ZCCloud可将总资本成本降低高达45%,成本效益(每美元计算吞吐量)提升高达34%。
- 在电力价格较高的地区,ZCCloud的成本性能优势达55%,显示出立即的经济可行性。
- 当硬件成本降至基线的0.25倍时,ZCCloud的成本效益最高可提升97%,凸显其与硬件商品化的强协同效应。
- 若系统功耗密度提高五倍(预计10年内实现),由于冷却和基础设施需求减少,ZCCloud的成本效益将提升116%。
- 对于功耗超过100MW的极端规模系统,ZCCloud在固定预算下可实现45%的资本成本降低,并将峰值PFLOPS提升80%,展现出变革性潜力。
- 仅MISO电网的搁浅电力(可达数百兆瓦,工作负载率高达80%)即可支持大规模、持续的HPC工作负载,验证了ZCCloud模型的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。