[论文解读] Cloud Services Enable Efficient AI-Guided Simulation Workflows across Heterogeneous Resources
本文提出了一种基于FaaS的原生云工作流框架,结合FuncX与Globus,实现跨异构HPC和GPU资源的高效、安全且可移植的AI引导模拟工作流。通过利用按引用传递数据传输和用户可配置的动态控制,该方法在保持与传统直接连接工作流科学性能相当的同时,简化了部署流程并降低了操作复杂性。
Applications that fuse machine learning and simulation can benefit from the use of multiple computing resources, with, for example, simulation codes running on highly parallel supercomputers and AI training and inference tasks on specialized accelerators. Here, we present our experiences deploying two AI-guided simulation workflows across such heterogeneous systems. A unique aspect of our approach is our use of cloud-hosted management services to manage challenging aspects of cross-resource authentication and authorization, function-as-a-service (FaaS) function invocation, and data transfer. We show that these methods can achieve performance parity with systems that rely on direct connection between resources. We achieve parity by integrating the FaaS system and data transfer capabilities with a system that passes data by reference among managers and workers, and a user-configurable steering algorithm to hide data transfer latencies. We anticipate that this ease of use can enable routine use of heterogeneous resources in computational science.
研究动机与目标
- 解决在异构计算资源上高效、安全且可移植地执行AI引导模拟工作流日益增长的需求。
- 降低多资源科学工作流中的部署复杂性,并消除单点故障。
- 通过智能动态控制与高效数据传输,最小化AI与模拟工作负载中的数据传输延迟与开销。
- 证明云托管服务可实现与传统直接连接工作流系统相当的性能。
- 通过简化安全、可扩展且可靠的跨资源编排,推动异构计算在计算科学中的广泛应用。
提出的方法
- 采用联邦式函数即服务(FaaS)平台(FuncX)在无需直接资源连接的情况下,管理HPC与GPU资源上的远程任务执行。
- 使用ProxyStore通过引用实现对等、基于Globus的数据传输,最大限度减少中心控制器的数据移动。
- 集成Colmena以表达用户可配置的动态控制策略,通过重叠计算与I/O操作隐藏数据传输延迟。
- 通过引用传递任务指令与数据,降低控制器负载,避免大规模、数据密集型工作流中的瓶颈。
- 利用云托管的协调服务实现身份认证、授权与错误处理,提升可靠性并降低部署复杂性。
- 通过合成工作负载及两个真实应用场景(分子设计与代理模型训练)进行性能基准测试。
实验结果
研究问题
- RQ1云托管的FaaS与数据传输服务是否能在AI引导模拟工作负载中实现与传统直接连接工作流系统相当的性能?
- RQ2按引用传递数据传输与智能动态控制在降低多资源科学工作流端到端延迟方面的效果如何?
- RQ3数据大小与传输机制(如Redis与Globus)对任务开销与工作流性能有何影响?
- RQ4云托管服务在多站点异构科学计算环境中,能在多大程度上简化部署并提升可靠性?
- RQ5FaaS、数据引用传递与动态控制的集成是否能实现可扩展、安全且可移植的AI-模拟工作流,同时不牺牲科学准确性?
主要发现
- 使用云托管工作流(FuncX + Globus)生成的代理模型的RMSD为1.30 ± 0.08 eV/Å,与传统Parsl方法(1.47 ± 0.09 eV/Å)相当,证明了科学性能的等效性。
- GPU任务的任务开销主要由Globus数据传输时间主导,单向平均约为2秒,与合成基准测试结果一致。
- 对于CPU任务,FuncX的开销主要源于发送至控制器的通知延迟;而Parsl的开销随数据大小增加而增长——3 MB消息为820 ms,20 kB消息为20 ms。
- 对于大消息,按引用传递显著降低了数据传输开销,Parsl中引用传递的传输时间保持稳定:采样为200 ms,模拟为170 ms。
- 采用按引用传递与智能动态控制,相比朴素数据传输方法,可将应用延迟降低最多10倍。
- 当数据量超过10 kB时,通过Globus或Redis(若可行)直接传输比通过控制器代理更高效,且在存在直接隧道时Redis速度更快。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。